跳到正文
今天10月7日周三1 条
10月6日周二
  1. Mistral AI77

    Mistral AI 发布 Mistral Large 4:1 万亿参数原生多模态模型开启公开预览

    Mistral AI 发布 Mistral Large 4(ML4)公开预览,1 万亿参数、490 亿活跃参数的原生多模态模型,为其迄今最大最强模型。权重将于本月底开放,模型在 Mistral 自有欧洲数据中心基于 3,800 块 NVIDIA Grace Blackwell GPU 完成训练。

    推荐理由:官方公布 ML4 在网络安全、编码与多模态基准上与闭源模型的对比数据,读者可据此判断开放权重模型的当前位置。

10月5日周一
10月3日周六
  1. OpenAI News60

    GPT-6 系列模型实践指南

    OpenAI 发布 GPT-6 系列模型实践指南,说明创业公司如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具,并为生产环境准备工作流。

    推荐理由:指南覆盖模型选型、推理强度调节与生产工作流准备,可直接用于 GPT-6 多版本之间的选型与调参决策。

10月2日周五
  1. GitHub Blog · AI & ML37

    AI 正在改变开发者工作:三项需要强化的技能

    AI 正在改变开发者工作,GitHub 提出三项需要强化的技能:指挥 AI 智能体、不盲信 AI 的首个答案、用 AI 解决更大的问题。例如让第二个 AI 模型审查第一个模型的输出:GitHub Copilot 内置的 Rubber Duck 智能体即用第二模型在推进前评审方案、代码与测试。当 AI 承担更多实现,清晰定义问题、评估权衡与做出技术决策等人类判断力反而更关键。

10月1日周四
  1. Google DeepMind78

    Gemini 4 Argon 发布:下一代前沿智能

    Google DeepMind 发布前沿模型 Gemini 4 Argon,面向真实软件工程、法律金融等企业知识工作与网络安全防御,可在长程复杂工作流中维持深度推理。

    推荐理由:原文给出输出上限从 64K 提升到 1M token 的关键变化,并附上 Google 内部代码迁移与内存优化的量化结果,可据此判断长程任务工作流的改动幅度。

9月30日周三
9月29日周二
  1. Microsoft Research72

    Microsoft Research 推出 Quine:面向生物学复杂性的 AI 研究系统

    Microsoft Research 发布 Quine,一个面向生物学的多模态世界模型与交互式研究系统,把模型、科研工具、文献与湿实验连接进闭环。在与 Broad Institute(哈佛与 MIT)合作的胰腺导管腺癌研究中,Quine 用一个周末完成数千化合物的预测与排序,最高排名化合物在多个湿实验中产生了最大的靶向细胞状态转变。

    推荐理由:原文展示了多模态生物世界模型如何与湿实验形成闭环,读者可据此判断 AI 在药物筛选与实验设计中的实际作用边界。

9月28日周一
  1. Hugging Face Blog68

    Holo4 发布:通用计算机操作智能体系列,含 27B dense 与 35B-A3B MoE 两款

    Hcompany 发布 Holo4 系列智能体模型,包含 27B dense 与 35B-A3B MoE 两种尺寸,可通过 GUI、代码、MCP 和 API 与软件交互,同一模型可跨桌面、网页、Android、代码沙箱与业务 API 运行。

    推荐理由:原文给出了多接口能力说明与 OSWorld 2.0 成本性能对比,读者可据此判断开源智能体模型相对闭源前沿模型的取舍。

9月26日周六
  1. GitHub Blog · AI & ML44

    GitHub Copilot app 新手教程:如何用 canvases 构建自定义工作流

    GitHub Copilot app 的 canvases 是用户与 agent 双向共享的可定制界面,可做成看板、问题分流板或清单等形态。在 agent 会话中输入 /create-canvas 并用自然语言描述工作流,agent 即会生成界面并在右侧面板打开,无需手写代码。创建后可持续调整,也能作为扩展保存给团队共享,或从 Awesome Copilot 安装现成模板再定制。

9月25日周五
  1. Google Research64

    Google Research 发布连贯长视频生成研究框架套件 Co-Director、CANVAS、A²RD 与 VQQA

    Google Research 发布面向连贯长视频生成的研究框架套件,将长视频生成建模为全局优化与世界状态追踪问题,在多镜头叙事一致性与角色持久性上取得显著提升。

    推荐理由:原文把长视频生成拆解为全局优化与世界状态追踪四个框架,并给出各基准上的量化提升,可据此对照现有 Agent 编排管线的短板。

  2. Google DeepMind64

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar 实时虚拟形象功能

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将近实时视频生成与语音结合,为 Gemini 实时对话模型增加能看、能听、能说的动态虚拟形象。该功能今天起在 Gemini Enterprise 可用,支持后台异步工具调用、97 种语言间的无缝语音同步切换,以及基于参考图像定制品牌虚拟形象,所有音视频输出均带 SynthID 水印。

    推荐理由:原文列出了实时视觉形象、后台异步工具调用与 97 种语言同步能力,读者可据此评估企业级虚拟客服的落地方式。

9月9日周三