跳到正文
10月7日周三
  1. Microsoft Research22

    Microsoft 研究:AI 评测为何在传统 benchmark 之外出现“意外失败”

    Microsoft 的 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她结合自身从数学、物理、认知科学转向计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。

9月25日周五
9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解 AI 热门观点:该不该读 AI 生成的代码、RAG 是否已死、Skills 是否杀死了 MCP

    GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是智能体连接工具与数据的标准;RAG 并未死亡,检索能让模型从更接近答案的位置起步,减少 token 消耗和回答不完整。节目还讨论了企业招聘中的 AI 使用判断力,以及微调需求往往暴露的是代码库可维护性问题。

7月7日周二