研究团队把 LeCun 的 JEPA 扩展为跨领域的通用世界模型 JEPA-Anything
PhAI Labs 联合 Stanford、Oxford、Princeton 的研究团队提出 JEPA-Anything,把 JEPA 的预测状态拆成四个正交因子、各自配备预测模块后再重组,以避免简单模式淹没困难模式。
PhAI Labs 联合 Stanford、Oxford、Princeton 的研究团队提出 JEPA-Anything,把 JEPA 的预测状态拆成四个正交因子、各自配备预测模块后再重组,以避免简单模式淹没困难模式。
Reflection 发布首个免费模型 Beam,面向编码、逻辑推理与智能体任务,MoE 架构总参数 501B、每 token 激活 23B。据 Reflection,Beam 在高难度推理任务上以少三到四倍的算力匹配 GLM 5.2,其强化学习阶段使用了 10,500 块 Nvidia GB300 GPU、运行超过四周。
开发者 Niko1221 开源 Strata 引擎,可在 12GB 显存以上的消费级显卡上运行量化版 Qwen3.8-Flash-Next(1250 亿参数)模型。
推荐理由:原文给出把 MoE 专家分级载入 RAM 加投机解码的显存优化思路,可迁移到其他大模型本地部署场景。
Reflection AI 正式发布首个开源权重前沿模型 Beam,定位为面向企业、公共部门和开发者的主力模型。Beam 为纯文本 MoE 模型,总参数 501B、激活参数 23B,在 23.8T tokens 上预训练,上下文窗口 100 万 token。
过去一年,OpenAI、Anthropic 等 AI 实验室在多个长期悬而未决的数学难题上取得突破,甚至攻克了一道千禧年大奖难题,却在学术界引发强烈反弹与争议。OpenAI 表示正咨询顶尖数学家以避免再次失误,但这些承诺能否兑现仍有待观察。
Aleph Alpha 发布德英双语模型 Kolibri,总参数 78B,每 token 激活约 3B,权重以 Apache 2.0 许可在 Hugging Face 开源。
OpenAI 发布 GPT-6 系列模型实践指南,说明创业公司如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具,并为生产环境准备工作流。
推荐理由:指南覆盖模型选型、推理强度调节与生产工作流准备,可直接用于 GPT-6 多版本之间的选型与调参决策。
LLM 只是不断预测下一个 token,本质上是快速直觉式的系统 1 思维,并不具备真正的推理能力。AlphaGo 的第 37 手来自显式构建并搜索博弈树的独立推理机制,而聊天机器人的 chain of thought 仍由同一套 next-token 预测迭代生成,且常常事后编造推理路径。
Latent Space 专访 MIT 博士生 Alex Zhang,讨论递归语言模型(RLM)、AI 生成 GPU kernel 与 harness 设计。RLM 以代码为唯一工具、把上下文卸载到代码环境中的内存,训练短任务可直接泛化到 8–30 倍长度的任务以及完全不同的任务类型。
GPT-6 Astra Ultrafast 现已通过 OpenAI API 提供,运行在 NVIDIA Blackwell GPU 上,并向符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:原文给出了 Astra Ultrafast 相对 Standard 模式最高 8 倍的 token 生成速度对比,读者可据此判断其对编码智能体工作流的影响。
Google DeepMind 发布前沿模型 Gemini 4 Argon,面向真实软件工程、法律金融等企业知识工作与网络安全防御,可在长程复杂工作流中维持深度推理。
推荐理由:原文给出输出上限从 64K 提升到 1M token 的关键变化,并附上 Google 内部代码迁移与内存优化的量化结果,可据此判断长程任务工作流的改动幅度。
CoreWeave 在旧金山举行的 CoreWeave Fully Connected 大会上宣布 NVIDIA Vera Rubin NVL72 系统在 CoreWeave Cloud 上可用,并推出统一的训练与评估环境 CoreWeave Forge。
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,用离线 RL 将数据库感知的查询分解编译为监督信号,推理时无需思考 token 即可单次生成属性对齐的查询扇出。
多校研究者推出 SPADE 框架,让 LLM 在自博弈中交替生成可执行训练环境并尝试求解,用强模型生成的合成数据反哺模型自身训练。SPADE 在 Qwen3-30B-A3B-Instruct-2507 上经 GRPO 微调后,游戏环境套件平均分达 58.3,较 base 提升 8.1;METR 另分析称 AI 显著加速了网络安全漏洞发现,对数学研究仅有小幅加速,对 AI 研究优化尚无可测加速。
Berkeley AI Research 的分析指出,自适应并行推理正成为高效推理扩展的下一个范式——由模型自行决定何时分解子任务、生成多少并发线程并加以协调。