跳到正文
今天10月7日周三2 条
  1. Google DeepMind76

    EmbeddingGemma 2 发布:开源轻量级多模态嵌入模型

    Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、740M 参数的开源轻量级多模态嵌入模型,采用 Apache 2.0 许可,可将文本、图像、音频和视频统一映射到同一嵌入空间。

    推荐理由:原文给出了参数量、模态拆分与量化后的内存占用,便于读者判断它能否直接落到自家端侧检索链路中。

10月6日周二
  1. TechCrunch · AI70

    Mistral Large 4 发布:1T 参数多模态模型,瞄准超越闭源与开源对手

    Mistral AI 发布多模态大模型 Mistral Large 4(ML4,昵称 Le Chonk),参数量达 1T,目前仅能通过公开护栏端点访问,计划在三周内完成安全测试后开放权重。ML4 完全使用 Mistral 自有算力训练,仅动用 4000 块 Nvidia GPU,官方称比中国竞争对手少两到三倍;基准结果尚未公布,优化方向包括网络安全、金融与芯片设计。

  2. Mistral AI77

    Mistral AI 发布 Mistral Large 4:1 万亿参数原生多模态模型开启公开预览

    Mistral AI 发布 Mistral Large 4(ML4)公开预览,1 万亿参数、490 亿活跃参数的原生多模态模型,为其迄今最大最强模型。权重将于本月底开放,模型在 Mistral 自有欧洲数据中心基于 3,800 块 NVIDIA Grace Blackwell GPU 完成训练。

    推荐理由:官方公布 ML4 在网络安全、编码与多模态基准上与闭源模型的对比数据,读者可据此判断开放权重模型的当前位置。

  3. The Decoder61

    Reka AI 发布全模态模型 Rho-1:单一模型处理文本、图像、视频与机器人控制

    Reka AI 发布 Rho-1 研究预览版,这是一个 190 亿参数的全模态模型,可在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。所有模态作为 token 在一个共享上下文窗口中运行,无需工具调用或外部模型,同一套预测相机图像的权重也驱动机器人运动。

9月29日周二
  1. Microsoft Research72

    Microsoft Research 推出 Quine:面向生物学复杂性的 AI 研究系统

    Microsoft Research 发布 Quine,一个面向生物学的多模态世界模型与交互式研究系统,把模型、科研工具、文献与湿实验连接进闭环。在与 Broad Institute(哈佛与 MIT)合作的胰腺导管腺癌研究中,Quine 用一个周末完成数千化合物的预测与排序,最高排名化合物在多个湿实验中产生了最大的靶向细胞状态转变。

    推荐理由:原文展示了多模态生物世界模型如何与湿实验形成闭环,读者可据此判断 AI 在药物筛选与实验设计中的实际作用边界。

9月25日周五
  1. Google Research64

    Google Research 发布连贯长视频生成研究框架套件 Co-Director、CANVAS、A²RD 与 VQQA

    Google Research 发布面向连贯长视频生成的研究框架套件,将长视频生成建模为全局优化与世界状态追踪问题,在多镜头叙事一致性与角色持久性上取得显著提升。

    推荐理由:原文把长视频生成拆解为全局优化与世界状态追踪四个框架,并给出各基准上的量化提升,可据此对照现有 Agent 编排管线的短板。

  2. Google DeepMind64

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar 实时虚拟形象功能

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将近实时视频生成与语音结合,为 Gemini 实时对话模型增加能看、能听、能说的动态虚拟形象。该功能今天起在 Gemini Enterprise 可用,支持后台异步工具调用、97 种语言间的无缝语音同步切换,以及基于参考图像定制品牌虚拟形象,所有音视频输出均带 SynthID 水印。

    推荐理由:原文列出了实时视觉形象、后台异步工具调用与 97 种语言同步能力,读者可据此评估企业级虚拟客服的落地方式。

9月1日周二