📊 大模型价格战全面爆发
多家巨头在 7 月初密集发布新模型,价格战进入白热化阶段:
- Grok 4.5(SpaceXAI):$2/$6(输入/输出每百万 Token)
- Muse Spark 1.1(Meta):$1.25/$4.25,100 万 Token 上下文窗口
- GPT-5.6 Luna(最低端):$1/$6
- Claude Sonnet 5(Anthropic):$2/$10 推广期,8 月后涨至 $3/$15
- 对比参考:Opus 4.8 输出 $25/百万 Token,GPT-5.6 Sol 输出 $30
核心趋势:新中端模型以 5% 的价格提供约 80% 的旗舰性能,多模型组合策略已成企业最优解。
🔬 前沿研究突破
1. 推理模型关键发现(MIT & Stanford)
- 模型成功推理的核心不是参数量,而是训练中自我纠错能力
- 学会了自我修正的小模型,可以超越生成更长但不纠正的大模型
- 多家实验室已据此调整训练方向
2. 长程任务规划(DeepMind)
- 提出"前瞻性信用分配"(Prospective Credit Assignment)训练方法
- 在 SWE-Bench 上,10 步以上复杂任务的成功率显著提升
- 这是可靠 AI Agent 的关键前置条件
3. 幻觉根源研究(Allen AI)
- 幻觉主要发生在训练数据中稀缺但并非完全缺失的事实上
- 高度精选、平衡的数据集可显著减少幻觉
- RAG(检索增强生成)仍是高可靠性场景的最佳实践
4. 长视频理解(Meta AI)
- 新方法可将视频表示高效压缩,支持 30 分钟以上视频的问答
- 此前 SOTA 对长视频理解能力退化严重
🚀 重要产品发布
OpenAI GPT-5.6 三档分级
- Sol:旗舰版,Max 推理模式,Ultra 子 Agent 模式,ARC-AGI-3 得分 7.8%
- Terra:平衡版,GPT-5.5 级别能力、半价
- Luna:高速廉价版
- ⚠️ Sol 因网络安全能力过强,被美国政府限制仅向 20 家受信机构开放
Anthropic Claude Sonnet 5
- 主打 Agent 编码和自动化工作流
- 在 Slack 中推出 Claude Tag 功能——@提及即分配任务,自动拉取 Google Drive 文件、分解步骤、更新文档
- 65% 的企业用户已在试用该功能
Meta Muse Spark 1.1
- 100 万 Token 上下文窗口
- 支持并行子 Agent 代理
- 可操控桌面、移动端和浏览器界面
- 首次推出付费 API($20 免费额度,仅美国)
- 不定向开放权重(Meta 战略转向)
其他值得关注
- NVIDIA Nemotron-Labs-TwoTower:开源扩散语言模型,并行生成文本,吞吐量提升 2.42 倍,质量保持 98.7%
- Google TabFM:零样本表格数据模型,无需任务特定训练
- Kimi K2.7 Code 成为 GitHub Copilot 首个开放权重模型
- Cognition SWE-1.7:以 1000 tok/s 速度运行,FrontierCode 得分 42.3%
💼 行业动态
📉 微软裁员 4,800 人
- Xbox 利润率危机加深,AI 芯片需求推高硬件成本
- 前任 Xbox CEO 加入美联储 AI 生产力工作组
🔧 DeepSeek 自研推理芯片
- 旨在摆脱对 Nvidia 和华为的依赖
- 中国 AI 芯片自主化进入实质性阶段
💰 Reflection AI 锁定 63 亿美元算力
- 通过 2029 年的算力合同,基础设施投资持续加码
🍔 星巴克自建 AI 软件
- 开始内部开发 AI 应用以替代微软产品
- 企业 SaaS 模式面临自主 AI 代理的威胁
🌐 AI 通胀效应
- 内存芯片需求推高 MacBook、Xbox 等消费电子产品价格
- 印度 MacBook Pro 涨幅达 ₹70,000(约 $1,000 CAD)
- Micron 成为美国交易量最大的个股
🔮 趋势总结
- 模型价格战加速:中端模型性价比大幅提升,"多模型组合"是企业明智选择
- Agent 化是主线:新模型设计目标从"回答问题"转向"操作软件、执行任务"
- 监管趋严:前沿模型因安全顾虑被政府限制访问,ID 验证、水印、信用额度制成为标配
- AI 成本向消费者传导:芯片需求推高消费电子价格,AI 通胀效应显现
- 硬件层分化:中国实验室自研芯片,全球算力格局重塑中
信息来源:ThursdAI、AI Apps、Kersai、SkyCrumbs、AI Weekly、AP News 等跨平台汇总