跳到正文
10月6日周二
  1. The Verge · AI34

    AI 接管数学领域背后的种种风波

    过去一年,OpenAI、Anthropic 等 AI 实验室在多个长期悬而未决的数学难题上取得突破,甚至攻克了一道千禧年大奖难题,却在学术界引发强烈反弹与争议。OpenAI 表示正咨询顶尖数学家以避免再次失误,但这些承诺能否兑现仍有待观察。

10月5日周一
10月3日周六
  1. OpenAI News60

    GPT-6 系列模型实践指南

    OpenAI 发布 GPT-6 系列模型实践指南,说明创业公司如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具,并为生产环境准备工作流。

    推荐理由:指南覆盖模型选型、推理强度调节与生产工作流准备,可直接用于 GPT-6 多版本之间的选型与调参决策。

10月2日周五
  1. MIT Technology Review · AI48

    别被忽悠了——LLM 并不会推理

    LLM 只是不断预测下一个 token,本质上是快速直觉式的系统 1 思维,并不具备真正的推理能力。AlphaGo 的第 37 手来自显式构建并搜索博弈树的独立推理机制,而聊天机器人的 chain of thought 仍由同一套 next-token 预测迭代生成,且常常事后编造推理路径。

  2. Latent Space55

    MIT Alex Zhang 谈 RLM 与智能体框架设计

    Latent Space 专访 MIT 博士生 Alex Zhang,讨论递归语言模型(RLM)、AI 生成 GPU kernel 与 harness 设计。RLM 以代码为唯一工具、把上下文卸载到代码环境中的内存,训练短任务可直接泛化到 8–30 倍长度的任务以及完全不同的任务类型。

  3. NVIDIA Blog73

    NVIDIA GPU 如何加速 OpenAI 的 GPT-6 Astra Ultrafast

    GPT-6 Astra Ultrafast 现已通过 OpenAI API 提供,运行在 NVIDIA Blackwell GPU 上,并向符合条件的 ChatGPT Work 和 Codex 用户开放。

    推荐理由:原文给出了 Astra Ultrafast 相对 Standard 模式最高 8 倍的 token 生成速度对比,读者可据此判断其对编码智能体工作流的影响。

10月1日周四
  1. Google DeepMind78

    Gemini 4 Argon 发布:下一代前沿智能

    Google DeepMind 发布前沿模型 Gemini 4 Argon,面向真实软件工程、法律金融等企业知识工作与网络安全防御,可在长程复杂工作流中维持深度推理。

    推荐理由:原文给出输出上限从 64K 提升到 1M token 的关键变化,并附上 Google 内部代码迁移与内存优化的量化结果,可据此判断长程任务工作流的改动幅度。

9月30日周三
9月16日周三
8月24日周一
  1. Import AI34

    Import AI 470:机器无权利;用 SPADE 自动化环境生成;用 Hawkeye 构建更优 GPU kernel

    多校研究者推出 SPADE 框架,让 LLM 在自博弈中交替生成可执行训练环境并尝试求解,用强模型生成的合成数据反哺模型自身训练。SPADE 在 Qwen3-30B-A3B-Instruct-2507 上经 GRPO 微调后,游戏环境套件平均分达 58.3,较 base 提升 8.1;METR 另分析称 AI 显著加速了网络安全漏洞发现,对数学研究仅有小幅加速,对 AI 研究优化尚无可测加速。

5月8日周五