跳到正文
  1. Hugging Face Blog66

    Liquid AI 开源 d1-3B 与 d1-omni-600M 端侧决策模型

    Liquid AI 发布 d1 决策模型家族的两款开源模型 d1-3B 和实验性的 d1-omni-600M。d1-3B 在 Decision Index 0.2.1 上得分 48.57,领先所有 4B 和 9B 模型以及 Decider 35B-A3B 的 47.11,支持文本与图像输入;d1-omni-600M 支持文本加图像或文本加音频。

    推荐理由:Liquid AI 开源两款决策模型,给出端侧延迟与七项基准对比,可据此判断小模型做结构化决策的可行性。

  1. OpenAI News80

    OpenAI 在 ChatGPT 全球上线 GPT-6 与 Intelligent UI

    OpenAI 宣布 GPT-6 正在 ChatGPT 中面向全球上线,并同步推出 Intelligent UI。官方称新版本响应更快,提供可视化内容与可直接探索和使用的交互体验。

    推荐理由:OpenAI 官方公布 GPT-6 在 ChatGPT 全球上线,并同步带来 Intelligent UI 的交互变化。

  2. Google DeepMind71

    Google DeepMind 发布 EmbeddingGemma 2 开源轻量多模态嵌入模型

    Google DeepMind 发布 EmbeddingGemma 2,一款基于 Gemma 4 架构、Apache 2.0 许可的开源多模态嵌入模型,参数量 740M,可把文本、图像、音频、视频映射到统一嵌入空间。

    推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一到同一嵌入空间,并给出端侧内存与向量截断的具体数字,便于判断本地多模态检索的可行性。

  1. Mistral AI80

    Mistral 发布 Mistral Large 4 公开预览,1 万亿参数原生多模态

    Mistral 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、520 亿激活参数的原生多模态模型,权重将于本月底开放。

    推荐理由:Mistral 官方给出 1 万亿参数开源权重模型的能力细节与开放节奏,可据此判断开源前沿模型的当前水位。

  1. Google DeepMind84

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起步价每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准表现和内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。

  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演指导,后者面向高并发配音与语音智能体。

    推荐理由:官方给出两款 TTS 的定位差异、可用入口与基准名次,便于判断语音生成在创作与规模化场景的取舍。

已经到底了