Google 发布 EmbeddingGemma 2,称其超越两倍体量的竞品嵌入模型
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,参数量 740M,号称是同类最紧凑模型,在多模态嵌入基准上超过两倍于其体量的竞品。
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,参数量 740M,号称是同类最紧凑模型,在多模态嵌入基准上超过两倍于其体量的竞品。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、740M 参数的开源轻量级多模态嵌入模型,采用 Apache 2.0 许可,可将文本、图像、音频和视频统一映射到同一嵌入空间。
推荐理由:原文给出了参数量、模态拆分与量化后的内存占用,便于读者判断它能否直接落到自家端侧检索链路中。
Mistral 发布迄今最大模型 Mistral Large 4(ML4)公开预览,API 现已通过 Mistral Studio 开放,权重计划 10 月底放出。
Mistral AI 发布多模态大模型 Mistral Large 4(ML4,昵称 Le Chonk),参数量达 1T,目前仅能通过公开护栏端点访问,计划在三周内完成安全测试后开放权重。ML4 完全使用 Mistral 自有算力训练,仅动用 4000 块 Nvidia GPU,官方称比中国竞争对手少两到三倍;基准结果尚未公布,优化方向包括网络安全、金融与芯片设计。
Mistral AI 发布 Mistral Large 4(ML4)公开预览,1 万亿参数、490 亿活跃参数的原生多模态模型,为其迄今最大最强模型。权重将于本月底开放,模型在 Mistral 自有欧洲数据中心基于 3,800 块 NVIDIA Grace Blackwell GPU 完成训练。
推荐理由:官方公布 ML4 在网络安全、编码与多模态基准上与闭源模型的对比数据,读者可据此判断开放权重模型的当前位置。
Mistral AI 发布 Mistral Large 4(ML4,代号 le Chonk)公开预览版,预览版 API 即日起在 Mistral Studio 开放体验,模型权重将于本月底开放下载。
Reka AI 发布 Rho-1 研究预览版,这是一个 190 亿参数的全模态模型,可在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。所有模态作为 token 在一个共享上下文窗口中运行,无需工具调用或外部模型,同一套预测相机图像的权重也驱动机器人运动。
Microsoft Research 发布 Quine,一个面向生物学的多模态世界模型与交互式研究系统,把模型、科研工具、文献与湿实验连接进闭环。在与 Broad Institute(哈佛与 MIT)合作的胰腺导管腺癌研究中,Quine 用一个周末完成数千化合物的预测与排序,最高排名化合物在多个湿实验中产生了最大的靶向细胞状态转变。
推荐理由:原文展示了多模态生物世界模型如何与湿实验形成闭环,读者可据此判断 AI 在药物筛选与实验设计中的实际作用边界。
Google Research 发布面向连贯长视频生成的研究框架套件,将长视频生成建模为全局优化与世界状态追踪问题,在多镜头叙事一致性与角色持久性上取得显著提升。
推荐理由:原文把长视频生成拆解为全局优化与世界状态追踪四个框架,并给出各基准上的量化提升,可据此对照现有 Agent 编排管线的短板。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将近实时视频生成与语音结合,为 Gemini 实时对话模型增加能看、能听、能说的动态虚拟形象。该功能今天起在 Gemini Enterprise 可用,支持后台异步工具调用、97 种语言间的无缝语音同步切换,以及基于参考图像定制品牌虚拟形象,所有音视频输出均带 SynthID 水印。
推荐理由:原文列出了实时视觉形象、后台异步工具调用与 97 种语言同步能力,读者可据此评估企业级虚拟客服的落地方式。
微软研究院联合华盛顿大学与 Providence 发布开源病理基础模型 GigaPath-Flash 与 GigaTIME-Flash,权重与代码以 Apache 2.0 许可在 HuggingFace 开放。