跳到正文
今天10月10日周六2 条
10月8日周四
10月7日周三
  1. Latent Space85

    OpenAI 内部模型发布 722 篇数学手稿,覆盖 500 个开放问题中的 90 个

    OpenAI 以博客、GitHub 仓库和推文形式公开了内部前沿模型的数学成果,共 722 篇手稿、归入 372 个相关结果族,来自约 4000 道研究问题的评测,平均每个结果消耗约 3 小时 ChatGPT Pro 思考算力,模型本身尚未发布。

    推荐理由:OpenAI 内部模型一次性产出 722 篇数学手稿,读者可据此了解这批结果的规模、算力成本与外界质疑。

  2. Microsoft Research22

    Microsoft 研究:AI 评测为何在传统 benchmark 之外出现“意外失败”

    Microsoft 的 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她结合自身从数学、物理、认知科学转向计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。

10月5日周一
10月3日周六