Anthropic 发布 Claude Haiku 5.5,价格最高下调 90%
Anthropic 发布 Claude Haiku 5.5,这是其最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内提示词的价格降幅最高达 90%。
推荐理由:Anthropic 小模型大幅降价并首次开放推理档位,读者可据此判断高并发任务的成本结构变化。
Anthropic 发布 Claude Haiku 5.5,这是其最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内提示词的价格降幅最高达 90%。
推荐理由:Anthropic 小模型大幅降价并首次开放推理档位,读者可据此判断高并发任务的成本结构变化。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,官方称其平均运行成本比 Haiku 4.5 低约 75%。
推荐理由:汇总了 Haiku 5.5 的定价、独立评测与 token 消耗数据,可据此判断小模型在智能体工作流中的成本取舍。
Anthropic 发布快速低成本模型 Claude Haiku 5.5,定价为每百万 token 输入 0.10 美元、输出 0.50 美元,与 OpenAI 上月的 GPT-6 Luna 一致,超过 100,000 token 后涨至 0.50/2.50 美元。
推荐理由:作者实测了 Haiku 5.5 的定价、tokenizer 变化与推理档位表现,读者可据此判断它与 GPT-6 Luna 的成本取舍。
Liquid AI 发布 d1 决策模型家族的两款开源模型 d1-3B 和实验性的 d1-omni-600M。d1-3B 在 Decision Index 0.2.1 上得分 48.57,领先所有 4B 和 9B 模型以及 Decider 35B-A3B 的 47.11,支持文本与图像输入;d1-omni-600M 支持文本加图像或文本加音频。
推荐理由:Liquid AI 开源两款决策模型,给出端侧延迟与七项基准对比,可据此判断小模型做结构化决策的可行性。
Mistral 表示其新模型 Le Chonk 能够与顶级闭源模型相抗衡,同时保持开放权重。
阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一款 1.6B 参数的语音识别模型,重点覆盖阿联酋方言,同时支持英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上平均 WER 为 20.92%,优于所用榜单快照中最佳公开结果 23.17%;内部阿联酋方言评测 WER 22.73%、CER 10.19%,比次优的 Qwen3-Omni 低 4.07 个百分点。
OpenAI 宣布 GPT-6 正在 ChatGPT 中面向全球上线,并同步推出 Intelligent UI。官方称新版本响应更快,提供可视化内容与可直接探索和使用的交互体验。
推荐理由:OpenAI 官方公布 GPT-6 在 ChatGPT 全球上线,并同步带来 Intelligent UI 的交互变化。
Google DeepMind 发布 EmbeddingGemma 2,一款基于 Gemma 4 架构、Apache 2.0 许可的开源多模态嵌入模型,参数量 740M,可把文本、图像、音频、视频映射到统一嵌入空间。
推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一到同一嵌入空间,并给出端侧内存与向量截断的具体数字,便于判断本地多模态检索的可行性。
Mistral 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、520 亿激活参数的原生多模态模型,权重将于本月底开放。
推荐理由:Mistral 官方给出 1 万亿参数开源权重模型的能力细节与开放节奏,可据此判断开源前沿模型的当前水位。
Reflection 发布 Beam,一个面向编码、智能体和科研的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 在本月发布。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 训练,已作为 Asta 的 Fast 模式上线并开放权重与训练数据。
推荐理由:原文给出了训练数据构造与过滤细节,以及 Fast 模式与 Thinking 模式的实测耗时对比,可据此判断小模型做科研报告生成的可行边界。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起步价每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准表现和内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演指导,后者面向高并发配音与语音智能体。
推荐理由:官方给出两款 TTS 的定位差异、可用入口与基准名次,便于判断语音生成在创作与规模化场景的取舍。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩、定价定位与开发者接入渠道,可据此判断语音智能体的落地成本与能力边界。
微软研究院发布 GigaPath-Flash 和 GigaTIME-Flash,用蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干替代原模型,在 PANDA 前列腺分级和 EBRAINS 脑肿瘤分型基准上以约 50 倍更少算力达到原 GigaPath 3% 以内的性能。