我们是否过度信任 AI 说"不"的能力
MIT Technology Review 刊文指出,AI 的拒绝能力已成为 AI 安全的"承重墙",但这一机制并不可靠。Anthropic 2021 年提出模型应"有用、诚实、无害",如今各大公司通过红队测试和 AI 训练 AI 的方式让模型学会拒绝有害提示词,但拒绝机制基于概率,determined miscreants 已多次突破。
MIT Technology Review 刊文指出,AI 的拒绝能力已成为 AI 安全的"承重墙",但这一机制并不可靠。Anthropic 2021 年提出模型应"有用、诚实、无害",如今各大公司通过红队测试和 AI 训练 AI 的方式让模型学会拒绝有害提示词,但拒绝机制基于概率,determined miscreants 已多次突破。
MIT Technology Review 与 Aventine 合作的文章指出,尽管马斯克称 Tesla Optimus 未来能以每台低至 2 万美元自动化几乎所有人类劳动、并预测 2027 年底前向公众发售,但许多机器人研究者对此持怀疑态度。
Toby Ord 分析指出,AI 群体(swarm)是一种新的推理扩展形式,4 智能体群体完成任务所需 token 总量约为单智能体的两倍,但因并行运行理论上可将耗时减半,且存在类似经济学"踩脚"参数的收益递减。
Import AI 第 474 期聚焦三项内容:Michael Levin 提出心智是来自柏拉图式模式空间的模式,身体与机器只是其进入物理世界的接口;太空中的 TPU 成为讨论话题;智谱(Zhipu)启动了一个外层 RSI 循环。Levin 认为算法机器与生化生命处于同一谱系,都能超越物理或算法实现本身。