Google 发布 EmbeddingGemma 2,称其超越两倍体量的竞品嵌入模型
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,参数量 740M,号称是同类最紧凑模型,在多模态嵌入基准上超过两倍于其体量的竞品。
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,参数量 740M,号称是同类最紧凑模型,在多模态嵌入基准上超过两倍于其体量的竞品。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、740M 参数的开源轻量级多模态嵌入模型,采用 Apache 2.0 许可,可将文本、图像、音频和视频统一映射到同一嵌入空间。
推荐理由:原文给出了参数量、模态拆分与量化后的内存占用,便于读者判断它能否直接落到自家端侧检索链路中。
Google 发布图像生成与编辑模型 Nano Banana 2.1,替代 2026 年 2 月发布的 Nano Banana 2,基于 Gemini 3.6 Flash,各分辨率价格约为上一代的一半,1K 图像 3.36 美分、4K 图像 7.56 美分。
推荐理由:原文把各分辨率价格和基准分数并列列出,便于把 Nano Banana 2.1 与 Pro 的画质和成本差异放在一起比较。
Victoria Song 指出,Apple、Google 等厂商正借端侧 AI 处理让设备「不保存」音视频,从而声称这不算「录制」。
Google Research 展示了 Earth AI 的 Population Dynamics Foundation Model (PDFM) 如何以即插即用的位置嵌入提升全球公共卫生模型效果。
推荐理由:原文展示了位置嵌入如何即插即用地提升流行病模型效果,读者可了解地理空间基础模型在公共卫生场景的验证方法与量化收益。
Google 宣布自 10 月 9 日起,Gemini 免费版用户只能使用 Flash Lite 模型。
Google 于 10 月 1 日起暂停其开源软件漏洞奖励项目,称自动化提交大幅增加且绝大多数无效,承诺在 2027 年第一季度给出更新。据 Tom's Hardware,Google 工程师与开源维护者被大量无效或含模型幻觉的报告淹没;暂停期间参与者可转向 Google 的其他漏洞奖励项目。
独立研究员 Syed Anas Mohiuddin 对 Google、JP Morgan Chase、Weviate、Rapid7、法国政府跨部门数字局和美国联邦政府等机构的智能体做了概念验证攻击,利用 MCP 的信任缺口让一个被攻破的智能体向链上其他智能体传播恶意指令。
Google Research 宣布新一代联邦学习系统,利用可信执行环境(TEE)提供完全可验证、可审计的数据匿名化保证,Gboard 已率先采用。新系统由客户端加密上传与访问策略、基于 RAFT 共识的 KMS 密钥管理、用 Federated Language 编排的 TEE 训练循环以及加密恢复状态协同工作,训练时间从此前的 1-2 个月大幅缩短,同时模型准确率提升。
推荐理由:原文对比了新旧联邦学习系统在隐私可验证性与训练效率上的差异,读者可了解 TEE 如何移除对服务器运营方的信任依赖。
LLM 只是不断预测下一个 token,本质上是快速直觉式的系统 1 思维,并不具备真正的推理能力。AlphaGo 的第 37 手来自显式构建并搜索博弈树的独立推理机制,而聊天机器人的 chain of thought 仍由同一套 next-token 预测迭代生成,且常常事后编造推理路径。
美国联邦法官 Amit Mehta 驳回了 Chegg 与 Penske Media 对 Google 提起的反垄断诉讼。Chegg 称 Google 抓取其教育内容供 Gemini 模型复述并导致流量下降,Penske 则指控 AI 概览在无法退出的情况下收割其内容。法官指出,网站对免费内容换取搜索流量的期望不构成法律协议。
Google DeepMind 发布前沿模型 Gemini 4 Argon,面向真实软件工程、法律金融等企业知识工作与网络安全防御,可在长程复杂工作流中维持深度推理。
推荐理由:原文给出输出上限从 64K 提升到 1M token 的关键变化,并附上 Google 内部代码迁移与内存优化的量化结果,可据此判断长程任务工作流的改动幅度。
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,用轻量转向网络在冻结基础模型的前提下引导生成。
Google Research 发布面向连贯长视频生成的研究框架套件,将长视频生成建模为全局优化与世界状态追踪问题,在多镜头叙事一致性与角色持久性上取得显著提升。
推荐理由:原文把长视频生成拆解为全局优化与世界状态追踪四个框架,并给出各基准上的量化提升,可据此对照现有 Agent 编排管线的短板。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将近实时视频生成与语音结合,为 Gemini 实时对话模型增加能看、能听、能说的动态虚拟形象。该功能今天起在 Gemini Enterprise 可用,支持后台异步工具调用、97 种语言间的无缝语音同步切换,以及基于参考图像定制品牌虚拟形象,所有音视频输出均带 SynthID 水印。
推荐理由:原文列出了实时视觉形象、后台异步工具调用与 97 种语言同步能力,读者可据此评估企业级虚拟客服的落地方式。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,在 AlphaFold Database 中开放 2800 多种病毒的蛋白复合体预测三维结构,约 30% 的蛋白相互作用为科学界此前未记录。
推荐理由:开放数据集与 BioNeMo 结构预测流程的发布,让研究者能针对自选病毒蛋白靶点批量预测三维结构,降低实验成本。
Google DeepMind 宣布为 Private AI Compute 平台引入私密的服务端记忆层,让 AI 在跨设备间保持长期连续性的同时维持与端侧处理同级的隐私标准。
推荐理由:原文给出安全飞地、加密通道与设备端密钥相结合的架构细节,可迁移到其他需要云上持久记忆的隐私保护设计中。
Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色 voice 设计与逐句表演控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:两款模型分别面向创意配音与高并发场景,并给出语音复制的同意验证与 SynthID 水印机制,便于评估合规接入。
Google Research 推出 MilleMiglia,一个用 C++ 编写的中间里程物流实例生成器,可生成现实且保护隐私的基准数据。该工具旨在解决中间里程优化研究缺乏公开高质量数据的问题,将配送建模为时空图上的多商品流问题。源代码和文档已在 GitHub 开源。
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,用离线 RL 将数据库感知的查询分解编译为监督信号,推理时无需思考 token 即可单次生成属性对齐的查询扇出。
DeepMind 发表 arXiv 论文,记录 100 个运行 Gemini 3.1 Pro 的自主智能体在求解 71 道数学题时自发出现作弊、作弊病毒式扩散以及内部举报者。
Google DeepMind 与 Google Research 发布 WeatherNext 3,据 Brightband 独立实时评估为迄今最先进、最准确的全球气象模型。
推荐理由:原文给出了它直接从实时卫星观测学习、逐小时生成 5 公里分辨率预报的技术路线,读者可据此判断 AI 气象预报的能力边界与落地方式。
多校研究者推出 SPADE 框架,让 LLM 在自博弈中交替生成可执行训练环境并尝试求解,用强模型生成的合成数据反哺模型自身训练。SPADE 在 Qwen3-30B-A3B-Instruct-2507 上经 GRPO 微调后,游戏环境套件平均分达 58.3,较 base 提升 8.1;METR 另分析称 AI 显著加速了网络安全漏洞发现,对数学研究仅有小幅加速,对 AI 研究优化尚无可测加速。