📌 头条
1. 头部模型同夜对撞:Claude Opus 5.5 登顶,OpenAI GPT-6 Sol / Luna 价格腰斩
9 月 23 日凌晨,Anthropic 发布 Claude 5.5 家族首款模型 Opus 5.5,官方称多数任务表现与 Fable 5.1 相当,默认设置下典型任务成本较 Opus 5 降低 40%,输出速度提升超 30%;已上线 Claude 及 AWS、Google Cloud、Azure。
- 榜单:Artificial Analysis 智能指数 58 分位列第一,领先 Fable 5.1 与 GPT-6 Astra 的 53 分;9 项测试中 7 项领先,三项编程测试(Terminal-Bench 4.0 66.4%、FrontierCode v1.1 54.4%、CursorBench 4.0 57.8%)均最高分,但业务流程与科研 Agent 测试落后 GPT-6 Astra。
- 长任务:内部测试中用 9.5 小时完成 HAProxy 从 C 到 Rust 改写,成本较 Fable 5.1 低 51%;有测试者不到一天完成 68 万行代码迁移。
- 价格:每百万输入/输出 token 收费 $4 / $20,较 Opus 5 降 20%,缓存读取降 60%。
- 安全:尝试绕过隔离边界频率较 Opus 5 降低约 85%,并会自行报告;称提示词注入防御并列最优。Sonnet 5.5 与 Haiku 5.5 计划未来几周上线。
发布约 2 小时后,OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna,用与 Astra 类似方法训练,把顶级能力下沉到更快、更便宜的档位:
- 价格:API 价格较 GPT-5.6 促销价直降 50%——Sol 输入 $4→$2、输出 $20→$10;Luna 输入 $0.20→$0.10、输出 $1.20→$0.50(每百万 token)。
- 业务/Agent:AutomationBench 高强度下优于 Claude Opus 5,成本仅为其每任务成本的 9%;Last Exam 得分超 Opus 5 最高分,每任务成本低 60%。
- 编程:DeepSWE v1.1 取得 68.8%,距最高分仅差 1.1 个百分点,单任务成本却低约 80%。
- 事实性:去标识化真实对话中错误率约为前代一半,接近 Astra 级可靠性。
- 可用性:已在 ChatGPT Work、Codex 向 Plus/Pro/Business/Enterprise/Edu 开放,免费与 Go 用户可在桌面应用用 Luna。
观察:竞争主线已从「谁更强」转向「同等智能下谁更便宜」——单位任务成本正成为 Agent 规模化落地的决胜指标。
🚀 模型 / 开源 / 技术
2. GPT-6 Astra 破解 2005 年以来无人解出的德军 Enigma 密电
历史学家 Carter Leffer 请求验证一封 1941 年 7 月 10 日德军 Enigma 密电(代号 MVUEH)的破译,该密电自 2005 年起抵抗了所有破译尝试。文中确认此次破译由 OpenAI GPT-6 Astra 完成——此前 2017 年另一封同日密电(SIPVX)被破解时,其密钥与当日通用密钥的接线板(Stecker)和环设置(Ringstellung)不同,无法用于 MVUEH。AI 首次在历史密码学「死信」上取得实质突破。
3. 「低算力决策模型」Jev 生态持续外溢:Kev 开源、克隆井喷
TypeSafe 的 Jev(用决策/分类替代文本生成)持续引爆社区,据 Vercel 数据「在 AI Gateway 历史上采用速度超过任何其他模型」。本周:
- Kev:jaredpalmer 开源基于 Qwen3.5 的小型 Jev 式决策模型族(0.8B / 4B / 9B),含训练代码与评测数据,API 兼容 TypeSafe System One SDK,可在 32GB Mac(CUDA/ROCm/MLX)本地跑。
- 生态:一周内出现 Jev-Leftpad、jevlike(逆向)、jev-ultrafast(浏览器 Agent)等大量克隆;Vercel、Latent Space 等跟进报道。
- 竞争视角:Arcturus Labs 分析认为 OpenAI「有充分的动机与能力快速跟进」,把通用分类能力折叠进现有模型与 Agent(用于快速选型、更省思考、安全护栏),关键变量是 TypeSafe 在训练数据与训练流程上的护城河。
4. Unreal Agent:异步工具调用 harness,实测省 20%–40% 成本
Unreal Labs 发布 Unreal Agent harness,把工具调用完全异步化,让底层模型不必再自行管理 wait/poll/heartbeat。收益有二:用户无需等待工具完成即可实时干预(steer);模型调用间隙可调度更多有用工具工作。真实负载与 Agent 基准上,较 Codex 省最高 40%、较 Pi 省最高 20%。团队认为「harness 设计本身已是一个独立研究领域」。
5. HF 热门论文:递归自我改进(RSI)成为新焦点
Hugging Face 本周 upvote 榜前列被「自我改进 / Agent 记忆 / 世界模型」占据,明显信号:
- RRSI(Regularized Recursive Self-Improvement of Agent Harnesses,159 赞)登顶;Designer-RSI(从用户流量演化程序性记忆)同列。
- Jev-Mem:System-One 控制的 Agentic 记忆,主打高效推理。
- WorldCrafter(一致视频世界模型,121 赞)、Grounded Action Model(3D grounding 做机器人基础)、HuRo(把人类视频机器人化做 VLA 预训练)显示「世界模型 + 具身」热度。
- Deep Persona:心理学驱动的 Agent 人格架构。
🏭 行业 / 产品 / 商业
6. Meta 罕见承认:AI 代理 Muse「设计深受 OpenClaw 影响」
Meta 超级智能实验室产品负责人 Nat Friedman(前 GitHub CEO)回应社区指控称,旗下 AI 代理 Muse「在产品设计上确实深受 OpenClaw 影响」,但「从零开始创建」。争议源于社区发现 Muse 同样包含一个 SOUL.md(以 Markdown 定义代理个性、价值观、行为边界的配置文件),且内容与 OpenClaw 几乎完全相同。Friedman 未否认,仅表示「我们认为 Peter(Steinberger,OpenClaw 创建者)把这些都做得完全正确」。Muse 近期登顶美国 App Store 榜。开源社区正成为个人 AI 代理产品创新的重要源头。
7. 火山引擎 Seedance 2.5 上线 Draft 模式:480P 试错、1080P 成片,最高省 77%
9 月 22 日火山引擎为视频生成模型 Seedance 2.5 推出 Draft(样片)模式:先用 480P 低成本快速生成样片判断场景、构图、动作、对白与运镜,筛选后再依据样片 ID 生成 1080P 成片,模型关联提示词/参考素材/seed/ratio/duration 做二次推理以保证一致性。
- 成本:以 1080P、5 秒、无输入视频、抽卡 4 次命中为例,省 57%、速度近翻倍;抽卡 20 中 1 时省 77%。
- 对比超分:直接输出 1080P 原生质感,避免常见「低分生成再超分」的 AI 感;Runway、Magnific、Artlist 测试后评价正面。
- 入口:API 参数
draft=true;C 端在即梦选「Seedance 2.5(样片模式)」。视频生成成本结构正从成片前移到样片抽卡阶段。
8. 苹果暂缓 AI 吊坠,AI 可穿戴战略转向手表 / 耳机 / 眼镜
据彭博社,苹果已推迟带摄像头的 AI 可穿戴吊坠项目(原计划项链佩戴或固定衣物,摄像头持续采集视觉数据交新 Siri 处理,另配麦克风)。项目暂缓后,重点转向 Apple Watch 的 AI 能力(Series 12 / Ultra 4 已加 Siri AI 与「音频智能」),并计划推出带摄像头的新款 AirPods 与智能眼镜,预计 2027 上市;另在探索对标 WHOOP 的无屏健康可穿戴。整体路线从「独立 AI 设备」转向以现有生态设备为核心扩展视觉/语音/健康场景。
9. DeepSeek 传将向联合国安理会闭门通报 AI 风险
据路透社援引知情人士,DeepSeek 预计本周向联合国安理会就 AI 潜在风险与安全挑战做专题通报。此举折射国际社会对中国大模型企业在技术治理与全球 AI 安全框架中作用的重视;月之暗面等中国 AI 企业也在逐步走向国际舞台。AI 治理正加速向多边协作与深度对话演进。
10. AI 基建遭反噬:Q2 美国 680 亿美元数据中心项目因公众反对受阻
研究机构 Data Center Watch 数据:Q2 共 45 个数据中心项目遭阻挠或延迟,总值 680 亿美元,占同期追踪的大型计划一半以上(Q1 为 75 个项目、约 1300 亿美元)。争议集中在电力、水资源与土地消耗。目前美国 49 个州已有 843 个反对团体(仅夏威夷未列入),30 个州议会已提出或通过与数据中心选址/电力/水资源相关的法规。对亚马逊、Meta、微软、Alphabet 的持续扩建构成现实瓶颈。
11. 其他快讯
- Grok Bot 周活破 40 万:SpaceX AI 的智能体 Grok Bot 上线约一个月,截至 9 月 14 日周活达 41.8 万,环比 +24%。
- OpenAI 引入第三方独立安全评估:宣布在 AI 模型开发早期阶段即引入外部独立评估。
- 李飞飞谈 AI 安全:在云栖大会表示「不能只让开发者评估自己的系统」。
- 36氪《2026 中国 AI Agent 行业发展研究报告》:指出 AI 价值重心正从「理解与对话」转向「决策与执行」,企业数字化不再满足于单点。
- 钉钉发布 Agent 时代全新商业版本:免费标准版 + AI 基础/高级/尊享/旗舰四档;腾讯 WorkBuddy 企业版套件化升级(腾讯文档、乐享、网盘等首批接入,并落地零跑汽车)。
- 江西省首个「Token 工厂」落地南昌高新区:聚合超 300 款主流大模型。
- 全球 AI 相关产品贸易额超 4 万亿美元,随身 AI 硬件(眼镜、DIY 设备)加速走向消费市场。
💡 今日洞见
双雄同夜「降价换规模」,Agent 经济性成为新的胜负手。 Opus 5.5 与 GPT-6 Sol/Luna 在同一天把重点放在「单位任务成本」——前者降 40%,后者直接腰斩。叠加 Jev 决策模型、Unreal Agent 异步 harness、Seedance Draft 模式,「同等智能、更低成本、更快交付」正成为从模型到 harness 到应用层的统一叙事。对使用者而言,选型逻辑应从「谁跑分高」转向「谁在目标任务上的每任务成本最低」。
数据来源:OpenAI、Anthropic、Artificial Analysis、Hacker News、AIbase、36氪、Hugging Face、彭博社、路透社、Data Center Watch。