Microsoft 研究:AI 评测为何在传统 benchmark 之外出现“意外失败”
Microsoft 的 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她结合自身从数学、物理、认知科学转向计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。
Microsoft 的 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她结合自身从数学、物理、认知科学转向计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Gemini 4 Argon 在编码、企业知识与网络安全防御上的能力与定价,可据此判断前沿模型的落地节奏。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型。
推荐理由:两款语音对话模型分别面向规模成本与高复杂度任务,给出了多项语音基准成绩和开发者接入渠道。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,新增结构化 CUDA-to-MLX 翻译层,让搜索以现有 CUDA 内核为知识库生成 Apple Silicon 内核。
推荐理由:原文给出跨平台内核迁移的具体方法与实测数据,读者可据此判断 CUDA 经验向 Apple Silicon 迁移的可行路径。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以应对长程交互中上下文无法无限扩展的问题。在 CollabBench 协作编程任务上,基于重建的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。
伯克利人工智能研究实验室(BAIR)公布 2026 届博士毕业生名单,其研究覆盖机器人、大语言模型与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for science 等方向。毕业生去向包括 OpenAI、Mistral AI、Amazon、Physical Intelligence 等机构,以及 UCLA、芝加哥大学教职和自主创业。
伯克利 AI Research 发布综述,梳理并行推理从固定并行走向自适应控制的研究进展。现有方法如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS 及 ParaThinker、GroupThink、Hogwild!
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而避免高维视觉模型中脆弱的"状态-输入"梯度。该方法针对长时程规划中计算图病态、非贪心结构导致局部极小值等问题,使基于学习世界模型的梯度规划更稳健。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步利用层次结构,以约 10 倍更少的消融实验达到 SPEX 的性能。