跳到正文
今天10月10日周六2 条
10月9日周五
  1. NVIDIA Blog38

    NVIDIA Omniverse 如何用前沿 AI 智能体把创意变成仿真应用

    NVIDIA 开发者正用前沿 AI 模型配合 Omniverse 库,通过自然语言指令构建仿真应用。文中展示了 GPT-6 Astra 参与的多个项目,包括仓库人形机器人仿真器、自动驾驶测试工作流、数字孪生传感器校验,以及用 Unitree G1 人形机器人做体育动作测试的 Robo Olympics,其中机器人 100 次仿真中 64 次越过单个栏架。

10月8日周四
  1. Google Research67

    Google Research 研究:AI 辅助提升专利撰写产出,但未必加速初级律师专业判断成长

    Google Research 与 NBER 发布一项为期三个月的专利撰写实地实验,将当时未发布的 Google Labs AI 专利写作助手(现属 Gemini Notebook)随机分配给 11 家知识产权律所的 133 名律师。

    推荐理由:三个月专利撰写实验区分了 AI 带来的即时产出提升与无辅助判断力的变化,为理解 AI 对专业能力的影响提供了实证。

  2. AWS Machine Learning Blog66

    AWS 上线 Claude Haiku 5.5

    AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用。

    推荐理由:文章给出 Haiku 5.5 在 Bedrock 上的能力定位、成本变化与调用方式,便于判断它在多智能体分层中的位置。

  3. NVIDIA Blog74

    NVIDIA 与 Microsoft 发布 RTX Spark 与 Windows 智能体基础设施

    在旧金山 Microsoft 活动上,NVIDIA 与 Microsoft 宣布为 Windows PC 上的 AI 智能体共同设计软硬件,Microsoft 宣布 OS 级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统控制下安全持久地在后台运行。

    推荐理由:NVIDIA 与 Microsoft 把智能体运行所需的系统级容器和本地算力硬件一并给出,读者可据此判断 Windows 端侧智能体的落地路径。

  4. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:3500 行代码的轻量智能体 RL 框架

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一 agent harness 直接参与训练,无需在训练框架内重写智能体。

    推荐理由:微软研究院开源 Agent Lightning v1.0,给出真实 harness 参与 RL 训练的设计取舍与实测增益,可据此判断自建智能体训练链路的成本。

10月7日周三
  1. AWS Machine Learning Blog42

    Cornerstone OnDemand 如何用 Amazon Bedrock 将数据库诊断时间缩短 78%

    Cornerstone OnDemand 基于 Amazon Bedrock 和 Strands Agents 构建多智能体系统 Orion AI,将数据库诊断时间从 45 分钟降至 10 分钟,降幅 78%。该系统还把手动生命周期步骤从 10 步以上压缩为 1 次交互(减少 70%),并将冗余告警中位数削减 65%。三人团队用六个月完成交付。

  2. Microsoft Research22

    Microsoft 研究员 Jennifer Neville 谈 AI 评测的意外失败与真实世界表现

    Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论了评测如何推动当前 AI 系统突破传统 benchmark 的性能边界,以及模型在超出传统基准测试时出现的"意外失败"。她指出,当结果偏离预期时,仔细审视训练数据至关重要,并分享了使用当前 AI 系统的实用建议。

10月6日周二
  1. Google Research32

    Google 发布智能体隐私与安全研讨会报告:从上下文完整性视角看开放与新兴问题

    Google 发布《智能体隐私与安全中的开放与新兴问题:上下文视角》研讨会报告,汇集 50 多位学界与业界专家,于 2025 年底在纽约 Google CAPS 研讨会上形成。报告基于上下文完整性(CI)理论,提出用上下文策略引擎在系统、模型、用户多层协同防护,应对提示注入、概率性控制流和自主委派等挑战。

10月5日周一
10月4日周日
  1. Hugging Face Blog71

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再依据终端后端状态和副作用而非生成文本判定成败,每个任务重复 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判定成败,并给出 20 次重复下的稳定性与成本数据。

10月2日周五
  1. Hugging Face Blog38

    ServiceNow CoreAI 推出 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,自动生成并验证新的可执行训练任务,并随模型进步动态调整课程。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完备性。

10月1日周四
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起步价每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准表现和内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。

9月26日周六
9月25日周五
  1. Google Research67

    Google Research 发布 AI 视频联合导演框架,实现连贯长视频生成

    Google Research 发布 AI video co-director 多智能体框架,作为 Gemini 与 Veo 之上的编排层,将长视频生成建模为全局优化与世界状态跟踪问题,缓解语义漂移和级联失败。

    推荐理由:Google 把长视频生成拆成四个可复用框架,读者可了解多智能体编排如何缓解语义漂移与级联失败。

  2. GitHub Blog · AI & ML60

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体,自动完成 C/C++ 模糊测试

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就能识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,读者可据此判断自动化安全测试的边界。

9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解 AI 热门观点:该不该读代码、RAG 是否已死、Skills 是否杀死了 MCP

    GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是智能体连接工具与数据的标准,二者可组合使用;RAG 并未消亡,它为模型提供训练数据之外的相关信息,能减少 token 消耗并让回答更有依据。

9月16日周三
  1. Mistral AI55

    Mistral 与 Mozilla 合作,为 Firefox Smart Window 提供模型支持

    Mistral 宣布与 Mozilla 达成合作,Firefox 的 AI 浏览助手 Smart Window(beta)改由 Mistral 模型驱动,先面向法国和北美用户,英国和德国预计今年晚些时候跟进。Mistral 表示会针对地区语言、方言和文化语境微调模型,并称 Smart Window 的对话默认不保存在 Mozilla 服务器上,合作方同意零数据留存。

  2. Google DeepMind80

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。

    推荐理由:官方给出两款语音模型的基准成绩、定价定位与开发者接入渠道,可据此判断语音智能体的落地成本与能力边界。

9月9日周三
  1. Mistral AI62

    Mistral 用 AI 智能体迁移 4 万行 Fortran 77 遗留代码

    Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对齐测试框架,用 Skill.md 引导智能体导出状态快照并在 C++ 侧校验,再用 Vibe CLI 启动上百个智能体解析调用树、结合 Mistral OCR 整理散落的 PDF 文档并逐节点提交 PR。

    推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 的完整流程,其中先建数值对齐测试再迁移的做法可迁移到其他遗留系统改造。

8月20日周四
7月26日周日
  1. Berkeley AI Research32

    Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互摘要

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。

7月7日周二
  1. Berkeley AI Research34

    智能免费之后怎么办?面向智能体、由智能体运行、由智能体构建的数据系统

    伯克利 EPIC Data Lab 提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分厂商低于 $0.10,数据系统面临三大新挑战:为智能体服务、运行智能体集群、由智能体合成。作者指出智能体的"agentic speculation"会让单次用户请求产生上千条 SQL 查询,其中 80-90% 子查询是重复工作,需重新设计查询接口与优化策略。