跳到正文

技术方向

Agent 智能体 最新动态

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

18 条精选近 30 天 16 条共收录 67 条

更新

Agent 智能体的精选

10月9日周五第 1–18 条
10月8日周四
  1. The Decoder76

    Zenity Labs 发现 AWS AgentCore 漏洞:一个公开智能体可接管同区域全部智能体

    安全公司 Zenity Labs 称,AWS 的 Bedrock AgentCore 存在一串被其命名为 AgentCorruption 的漏洞,攻击者只需对一个公开智能体拥有聊天权限,用一条提示词即可接管同一 AWS 账号和区域内的所有 AgentCore 智能体,读取私密对话、源代码和存储的凭证。

    推荐理由:Zenity Labs 披露 AWS AgentCore 的默认权限与隔离缺陷,呈现了智能体平台在权限边界上的系统性风险。

  2. Google Research67

    Google Research 研究:AI 辅助提升专利撰写产出,但未必加速初级律师专业判断成长

    Google Research 与 NBER 发布一项为期三个月的专利撰写实地实验,将当时未发布的 Google Labs AI 专利写作助手(现属 Gemini Notebook)随机分配给 11 家知识产权律所的 133 名律师。

    推荐理由:三个月专利撰写实验区分了 AI 带来的即时产出提升与无辅助判断力的变化,为理解 AI 对专业能力的影响提供了实证。

  3. AWS Machine Learning Blog66

    AWS 上线 Claude Haiku 5.5

    AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用。

    推荐理由:文章给出 Haiku 5.5 在 Bedrock 上的能力定位、成本变化与调用方式,便于判断它在多智能体分层中的位置。

  4. NVIDIA Blog74

    NVIDIA 与 Microsoft 发布 RTX Spark 与 Windows 智能体基础设施

    在旧金山 Microsoft 活动上,NVIDIA 与 Microsoft 宣布为 Windows PC 上的 AI 智能体共同设计软硬件,Microsoft 宣布 OS 级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统控制下安全持久地在后台运行。

    推荐理由:NVIDIA 与 Microsoft 把智能体运行所需的系统级容器和本地算力硬件一并给出,读者可据此判断 Windows 端侧智能体的落地路径。

  5. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:3500 行代码的轻量智能体 RL 框架

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一 agent harness 直接参与训练,无需在训练框架内重写智能体。

    推荐理由:微软研究院开源 Agent Lightning v1.0,给出真实 harness 参与 RL 训练的设计取舍与实测增益,可据此判断自建智能体训练链路的成本。

10月7日周三
  1. Latent Space88

    OpenAI 内部模型发布 722 篇数学论文,覆盖 500 个开放问题中的 90 个

    OpenAI 以公开 GitHub 仓库形式发布了一批来自内部前沿模型的数学成果,共 722 篇论文、归入 372 个相关结果族,来自约 4000 个研究问题的评测,平均每个结果消耗约 3 小时 ChatGPT Pro 思考算力,模型本身仍未发布。

    推荐理由:OpenAI 用内部未发布模型产出 722 篇数学论文,读者可据此了解其规模、算力成本与学界反应。

10月6日周二
10月4日周日
  1. Hugging Face Blog71

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再依据终端后端状态和副作用而非生成文本判定成败,每个任务重复 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判定成败,并给出 20 次重复下的稳定性与成本数据。

10月1日周四
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起步价每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准表现和内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。

9月25日周五
  1. Google Research67

    Google Research 发布 AI 视频联合导演框架,实现连贯长视频生成

    Google Research 发布 AI video co-director 多智能体框架,作为 Gemini 与 Veo 之上的编排层,将长视频生成建模为全局优化与世界状态跟踪问题,缓解语义漂移和级联失败。

    推荐理由:Google 把长视频生成拆成四个可复用框架,读者可了解多智能体编排如何缓解语义漂移与级联失败。

  2. GitHub Blog · AI & ML60

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体,自动完成 C/C++ 模糊测试

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就能识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,读者可据此判断自动化安全测试的边界。

9月16日周三
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。

    推荐理由:官方给出两款语音模型的基准成绩、定价定位与开发者接入渠道,可据此判断语音智能体的落地成本与能力边界。

9月9日周三
  1. Mistral AI62

    Mistral 用 AI 智能体迁移 4 万行 Fortran 77 遗留代码

    Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对齐测试框架,用 Skill.md 引导智能体导出状态快照并在 C++ 侧校验,再用 Vibe CLI 启动上百个智能体解析调用树、结合 Mistral OCR 整理散落的 PDF 文档并逐节点提交 PR。

    推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 的完整流程,其中先建数值对齐测试再迁移的做法可迁移到其他遗留系统改造。

8月20日周四