Microsoft 研究:AI 评测为何在传统 benchmark 之外出现“意外失败”
Microsoft 的 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她结合自身从数学、物理、认知科学转向计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。
Microsoft 的 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她结合自身从数学、物理、认知科学转向计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。
GitHub Copilot 提出用 canvas 替代聊天框作为与 AI 协作的主要界面。canvas 是运行在 GitHub Copilot 应用内的全栈小应用,可与 agent 双向通信,也能调用第三方 API 或在本地执行代码,例如用 canvas 管理 Winget 包、操作 SQLite 数据库。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是智能体连接工具与数据的标准;RAG 并未死亡,检索能让模型从更接近答案的位置起步,减少 token 消耗和回答不完整。节目还讨论了企业招聘中的 AI 使用判断力,以及微调需求往往暴露的是代码库可维护性问题。
UC Berkeley 的 Aditya G. Parameswaran 等人提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分厂商低于 $0.10,数据系统需应对三大挑战:为智能体服务、运行智能体集群、由智能体构建。