Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,官方称其平均运行成本比 Haiku 4.5 低约 75%。
推荐理由:汇总了 Haiku 5.5 的定价、独立评测与 token 消耗数据,可据此判断小模型在智能体工作流中的成本取舍。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,官方称其平均运行成本比 Haiku 4.5 低约 75%。
推荐理由:汇总了 Haiku 5.5 的定价、独立评测与 token 消耗数据,可据此判断小模型在智能体工作流中的成本取舍。
Mistral 表示,其开放权重模型 Le Chonk 能够与顶级闭源模型相抗衡。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、Apache 2.0 许可,740M 参数,可把文本、图像、音频和视频映射到统一嵌入空间。
推荐理由:官方给出 740M 参数、模块化编码器与端侧内存占用,可据此判断本地多模态检索的落地成本。
Reflection 发布 Beam,一个面向编码、智能体和科研的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,Apache 2.0 全量权重预计本月放出。
推荐理由:Reflection 从 stealth 状态发布 501B 总参数开源权重模型,并给出预训练与 RL 的算力规模,可对照同期中美开源模型的位置。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Gemini 4 Argon 在编码、企业知识与网络安全防御上的能力与定价,可据此判断前沿模型的落地节奏。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由多模态生物世界模型和连接模型、科学工具、文献与实验人员的交互式 harness 组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物,最高排名化合物在湿实验中产生了最大的经典到基底细胞状态转变,整个筛选到验证过程仅用一个周末。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演指导,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:官方给出两款 TTS 模型的语音定制能力、基准排名与开放渠道,可据此判断语音生成在配音和播客场景的可用程度。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型。
推荐理由:两款语音对话模型分别面向规模成本与高复杂度任务,给出了多项语音基准成绩和开发者接入渠道。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,用蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干替代原模型,在 PANDA 前列腺分级和 EBRAINS 脑肿瘤分型基准上以约 50 倍更少算力达到原 GigaPath 3% 以内的性能。