Ai2 如何用 GPU 时间预算与分层公平分配改造集群调度
Ai2 用 GPU 时间预算、分层公平分配和时间切片合约替换了原有的优先级调度器,把各研究项目该分多少 GPU 时间的争论从逐案运维操作变成透明的行政预算流程。
Ai2 用 GPU 时间预算、分层公平分配和时间切片合约替换了原有的优先级调度器,把各研究项目该分多少 GPU 时间的争论从逐案运维操作变成透明的行政预算流程。
Postman 在 Amazon Bedrock 上构建 Agent Mode,以 AI 原生方式覆盖 API 测试、文档、发现与实现,服务 4000 万开发者。
Amazon Bedrock 上线 OpenAI 的 GPT-6 Astra、Sol、Luna 系列模型,其中 GPT-6 Astra 支持最高 100 万 input tokens,Ultrafast 版本 API 推理速度最高提升 6 倍、达 300 tokens/秒。
Sophos 使用 OpenAI 的 Daybreak 将网络威胁调查时间缩短 96%,并自动化处理 52% 的 MDR 案例,同时保留人工监督。
NVIDIA 开发者正用前沿 AI 模型配合 Omniverse 库,通过自然语言指令构建仿真应用。文中展示了 GPT-6 Astra 参与的多个项目,包括仓库人形机器人仿真器、自动驾驶测试工作流、数字孪生传感器校验,以及用 Unitree G1 人形机器人做体育动作测试的 Robo Olympics,其中机器人 100 次仿真中 64 次越过单个栏架。
Amazon Bedrock AgentCore payments 正式可用,为 AI 智能体提供按需付费的托管能力,支持 x402 兼容端点,由基础设施层而非模型执行消费限额。
AWS 发布基于 Amazon SageMaker HyperPod 与 EKS 的多租户参考架构,让多个团队共享同一 GPU 集群。
Oracle 在招聘、工程和运营环节借助 ChatGPT Work 与 Codex,把专家知识转化为快速、可复用的工作流,将原本需要数天的工作缩短到几分钟。
《Gears of War: E-Day》本周正式上线 GeForce NOW,Ultimate 会员可以 GeForce RTX 5080 级性能云端游玩,并支持 NVIDIA DLSS 和 NVIDIA Reflex。
LegalOn 将每日 Codex 预估成本削减 65%,同时保持开发速度。该公司按任务类型分配 Astra、Sol 和 Luna 模型,并对预算进行策略性管理。
Pollo AI 借助 GPT-5.6、GPT-6 Astra 和 GPT-Image-2.5,帮助创作者将创意转化为精细图像和电影级视频广告。
作者在 HuggingChat 中开启 ML-intern 模式,用提示词驱动它完成数据构建、训练、评测和发布,两天内做出六个模型,总计算成本约 103 美元。
推荐理由:作者用 ML Intern 在两天内从零训出六个模型,并公开全部提示词与成本明细,可迁移到自己的训练流程。
OpenAI 捣毁了两起借助 AI 开展的影响力行动,这些行动利用虚假身份的“记者”和一家智库散播地缘政治信息。
Google Research 与 NBER 发布一项为期三个月的专利撰写实地实验,将当时未发布的 Google Labs AI 专利写作助手(现属 Gemini Notebook)随机分配给 11 家知识产权律所的 133 名律师。
推荐理由:三个月专利撰写实验区分了 AI 带来的即时产出提升与无辅助判断力的变化,为理解 AI 对专业能力的影响提供了实证。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用。
推荐理由:文章给出 Haiku 5.5 在 Bedrock 上的能力定位、成本变化与调用方式,便于判断它在多智能体分层中的位置。
在旧金山 Microsoft 活动上,NVIDIA 与 Microsoft 宣布为 Windows PC 上的 AI 智能体共同设计软硬件,Microsoft 宣布 OS 级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统控制下安全持久地在后台运行。
推荐理由:NVIDIA 与 Microsoft 把智能体运行所需的系统级容器和本地算力硬件一并给出,读者可据此判断 Windows 端侧智能体的落地路径。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 在预检索 ACL 过滤之上新增实时 ACL 校验,在查询时直接向权威数据源核实权限,避免依赖可能过期或映射错误的 ACL 数据。
GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用代码上下文识别无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提升一倍以上。
推荐理由:GitHub 用九个季度数据说明密钥泄露与人工修复的失衡,并给出把检测前移到 push 环节的模型方案。
Liquid AI 发布 d1 决策模型家族的两款开源模型 d1-3B 和实验性的 d1-omni-600M。d1-3B 在 Decision Index 0.2.1 上得分 48.57,领先所有 4B 和 9B 模型以及 Decider 35B-A3B 的 47.11,支持文本与图像输入;d1-omni-600M 支持文本加图像或文本加音频。
推荐理由:Liquid AI 开源两款决策模型,给出端侧延迟与七项基准对比,可据此判断小模型做结构化决策的可行性。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一 agent harness 直接参与训练,无需在训练框架内重写智能体。
推荐理由:微软研究院开源 Agent Lightning v1.0,给出真实 harness 参与 RL 训练的设计取舍与实测增益,可据此判断自建智能体训练链路的成本。
AWS 提出 Agentic Value Model 框架,用于替代为 RPA 设计的传统 ROI 模型,从时间节省、异常处理、决策质量和变更韧性四个维度衡量 agentic automation 的价值。
Qlik 基于 Amazon Bedrock 打造 Qlik Answers,为全球超 4 万家客户提供带来源引用的企业级问答,自 2026 年 2 月正式可用以来,其 Discovery Agent 已为客户发现超 10 万条洞察。
AWS 展示了一套自动化修复工作流,用 Amazon EventBridge 接收 AWS DevOps Agent 的调查完成事件,再由 AWS Lambda Durable Functions 调用 Amazon Bedrock 从预审工具白名单中选取修复动作。
AWS 设计了一个为期六周、每周约四小时的结构化项目,让非工程背景的业务人员用 Amazon Bedrock AgentCore、Strands Agents SDK 等工具构建可运行的 AI 原型。
Cornerstone OnDemand 基于 Amazon Bedrock 和 Strands Agents 构建多智能体系统 Orion AI,将数据库诊断时间从 45 分钟降至 10 分钟,降幅 78%。该系统还把手动生命周期步骤从 10 步以上压缩为 1 次交互(减少 70%),并将冗余告警中位数削减 65%。三人团队用六个月完成交付。
阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一款 1.6B 参数的语音识别模型,重点覆盖阿联酋方言,同时支持英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上平均 WER 为 20.92%,优于所用榜单快照中最佳公开结果 23.17%;内部阿联酋方言评测 WER 22.73%、CER 10.19%,比次优的 Qwen3-Omni 低 4.07 个百分点。
英伟达团队从 Nemotron 3 出发,用 SFT、RL 和生成-验证-改进推理流程打造竞赛专用模型,在 IOI 2026 与 IMO 2026 均达到金牌水平。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可据此复现领域专家模型的训练与推理流程。
OpenAI 为 ChatGPT for Teens 推出 College Planner,帮助学生管理大学申请,同时上线新的 flashcards、quizzes 以及一个青少年 AI 委员会。
Radisson Hotel Group 与 Accenture 合作,基于 OpenAI 技术打造了一款 ChatGPT 插件,帮助旅客在规划行程时查找、比较并预订酒店。
OpenAI 宣布 GPT-6 正在 ChatGPT 中面向全球上线,并同步推出 Intelligent UI。官方称新版本响应更快,提供可视化内容与可直接探索和使用的交互体验。
推荐理由:OpenAI 官方公布 GPT-6 在 ChatGPT 全球上线,并同步带来 Intelligent UI 的交互变化。
Google DeepMind 发布 EmbeddingGemma 2,一款基于 Gemma 4 架构、Apache 2.0 许可的开源多模态嵌入模型,参数量 740M,可把文本、图像、音频、视频映射到统一嵌入空间。
推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一到同一嵌入空间,并给出端侧内存与向量截断的具体数字,便于判断本地多模态检索的可行性。
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论了评测如何推动当前 AI 系统突破传统 benchmark 的性能边界,以及模型在超出传统基准测试时出现的"意外失败"。她指出,当结果偏离预期时,仔细审视训练数据至关重要,并分享了使用当前 AI 系统的实用建议。
Google Research 展示 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)作为公共卫生概念验证:它把匿名搜索趋势、人口流动、建成环境密度和环境决定因素压缩为按月更新的位置嵌入向量,无需任务特定微调即可直接接入现有流行病学模型。
NVIDIA 最新《State of AI in Telecommunications》报告显示,89% 受访者认为开源模型与软件对公司 AI 战略重要。NVIDIA 发布 300 亿参数的 Nemotron 3 Large Telco Model(LTM),由 AdaptKey 基于开源电信数据集微调,并开放端到端微调配方。
Mistral 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、520 亿激活参数的原生多模态模型,权重将于本月底开放。
推荐理由:Mistral 官方给出 1 万亿参数开源权重模型的能力细节与开放节奏,可据此判断开源前沿模型的当前水位。
Google 发布《智能体隐私与安全中的开放与新兴问题:上下文视角》研讨会报告,汇集 50 多位学界与业界专家,于 2025 年底在纽约 Google CAPS 研讨会上形成。报告基于上下文完整性(CI)理论,提出用上下文策略引擎在系统、模型、用户多层协同防护,应对提示注入、概率性控制流和自主委派等挑战。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布特征构建,包含来自 187 个开源仓库、覆盖 19 种语言的 219 个 pull request。
NVIDIA Inception 计划中的三家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划环节。iSono Health 的 FDA 认证 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,公司称灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已用于数十万患者;Ataraxis AI 则用病理切片预测治疗反应与复发风险。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再依据终端后端状态和副作用而非生成文本判定成败,每个任务重复 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判定成败,并给出 20 次重复下的稳定性与成本数据。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 训练,已作为 Asta 的 Fast 模式上线并开放权重与训练数据。
推荐理由:原文给出了训练数据构造与过滤细节,以及 Fast 模式与 Thinking 模式的实测耗时对比,可据此判断小模型做科研报告生成的可行边界。