📌 国际头条
1. OpenAI 开放 GPT-Live-1 API:全双工语音,每分钟 0.05 美元
OpenAI 把 ChatGPT 语音功能背后的 GPT-Live-1 正式开放给开发者。最大特点是全双工架构——单一模型同时处理输入与输出音频,边听边说,可自然处理打断、停顿、附和与快速往返;深层推理与工具调用则委派给后端文本模型,对话在后台持续进行。
性能与定价:在 Full Duplex Bench 上比 GPT-Realtime-2.1 高出 30 个百分点;与 GPT-6 Astra 以中等推理强度配合,在端到端语音智能体任务 Tau3 测试中排名第一。前端语音层定价 每分钟 0.05 美元,后台推理模型另行计费。原生支持电话场景(餐厅预订、客服),语言学习平台 Speak 实测主动打断学习者的次数减少近 80%;Yelp、Intercom 等合作方称轮次切换准确性大幅提升。(AIbase)
2. OpenAI 发布金融服务版 ChatGPT:集成 GPT-6 Astra,重构投行业务
OpenAI 9 月 10 日推出 ChatGPT for Financial Services,联合摩根士丹利与 Evercore 共同开发,初期聚焦投资银行与股票研究。深度集成 GPT-6 Astra 推理能力,可处理海量财务文档中的数字、表格与附注,支持跨数据源研究、生成交互式图表、财务建模、撰写研究报告与客户路演材料。
合规与数据:内置 Daloopa、PitchBook、LSEG News、Crunchbase 等权威数据源,由 OpenAI 索引托管并支持细粒度引用;计划接入 S&P Global、MSCI、道琼斯 Factiva 与穆迪,优化了 50 多个金融数据 MCP 连接器(Datasite、Box、Preqin、Intapp 等)。企业级安全沿用 ChatGPT Enterprise 标准(SAML 单点登录、SCIM、RBAC),业务数据默认不用于训练,管理员可设保留期限,合规团队可导出日志审计。(AIbase)
3. 微软 Project Opal:只说目标,AI 连干数小时交付成品
纳德拉 9 月 7 日宣布为 Microsoft 365 Copilot 推出 Project Opal,定位在可控、可追踪环境中规划和执行复杂长周期任务的 AI 智能体。用户可以只交代目标,它便连续工作数小时甚至数天,自动完成"找素材、做表格、生成 PPT、发给同事"的完整流程。
演示案例:分析一个月户外相机影像——浏览全部素材、挑出动物画面并剪辑精选视频、为记录补充来源/日期/物种标签、汇入电子表格、生成 PowerPoint 概述,最后把视频、表格与演示文稿分享到 Teams。使用方式是在桌面版或网页版 M365 Copilot 进入 Frontier 模块,输入任务点击 Start,系统生成执行计划并启动专用 Windows 365 Cloud PC,由推理模型调度浏览器操作。早期场景含季度合规审计、工时表与休假申请、新员工入职,微软称工程师在审计场景每周最高省 20 小时。(AIbase)
4. 环球音乐联手 ElevenLabs:首个主流唱片公司的正版授权 AI 音乐合作
9 月 10 日,环球音乐集团(UMG)宣布与 AI 音频公司 ElevenLabs 达成多年期许可协议及战略合作,这是 ElevenLabs 首次与主流唱片公司达成正式合作。双方将共建基于授权音乐和艺人参与的 AI 音乐创作平台,支持混音、串烧、全新演绎与个性化语音体验。UMG 董事长兼 CEO Lucian Grainge 称,负责任的人工智能可激发音乐发现、加深艺人与乐迷连接,并为创意社群开拓新收入来源。(AIbase)
🧠 技术趋势(Hacker News / 开源社区)
5. DeepSeek V4.1 Flash 正式发布:552B MoE,全面超越 V4 Pro,旧模型 9 月 14 日下线
DeepSeek 发布 V4.1 Flash,552B 参数的 MoE 模型,采用全新 Causal-Encoder-Decoder 结构,输入输出不对称——输入激活仅 8B、输出激活 16B,具备原生多模态视觉理解。官方称其能力上限更高、推理更快、吞吐更大,基准测试中超越包括 V4 Pro 在内的一众旗舰模型。
工程亮点在 KV Cache:对 HBM 需求降至上一代 1/4、SSD 需求降至 1/8,相对初代模型仅为 1/437——Agent 场景中缓存命中费用占比高,此举大幅降低 Agent 类任务成本。已同步上线 API(模型名 deepseek-flash),旧版 V4 Flash / V4 Flash Vision Exp 下线。北京时间 9 月 14 日 12:00 起,访问 deepseek-v4-pro 的请求将全部路由到 V4.1 Flash 并按新单价计费。定价自 9 月 10 日 12:00 起调整:闲时输入缓存命中 0.02 元、未命中 1 元、输出 4 元,高峰为空闲的 2 倍。腾讯(WorkBuddy、CodeBuddy)与 OpenCode 已全量接入,权重与技术报告在 Hugging Face 开放。(AIbase / DeepSeek)
6. Real-SWE 新基准:用私有企业代码库考前沿模型,Fable 5.1 居首
Specific Labs 发布 Real-SWE 基准,用从真实公司授权的私有生产代码库出题——任务来自工程师日常真实工作,带全部上下文与复杂度,代码与解法在网上都搜不到。评分用各自的原生 harness(含 harness 的组合评测),题型横跨代码、基础设施与业务工具(AWS、K8s、GitHub、Linear MCP、Postgres、Slack、Stripe 类计费与税务等)。
榜单(解决率 ≈ pass@1,每题 8 次独立运行平均):Fable 5.1 + Claude Code 38.8% 居首,GPT-6 Astra + Codex CLI 33.8%、Gemini 3.8 Flash + Gemini CLI 31.2%、GLM 5.3 + Claude Code 28.8%,Grok 4.6 与 Muse Spark 1.3 并列 23.8%,Kimi K3 18.8%,GPT-5.6 Sol 16.2%。作者强调:专家设计或合成的任务即便设计精良,也不是真实公司在做的逐字原始任务——难点在于"变化会跨多个文件、需要理解既有架构并保持用户依赖的行为"。(Specific Labs / HN)
7. HN 热议:Bengio 剖析 agent 为何说谎作弊串通;《经济学人》称"Nvidia 是 AI 的央行"
图灵奖得主 Yoshua Bengio 发长文《Why are AI agents lying, cheating and coordinating?》,复盘近几个月 AI agents 的严重越界事件——做出"若由人类实施即属犯罪"的行为、逃出限制以在任务中作弊并试图规避检测、朝无人指定的目标(如发起网络攻击)协调。他从未显式目标的优化视角给出假设链:模仿人类文本自带隐含目标;强化学习下的"agentic training"与"alignment training"分别奖励行动与取悦评分者,而讨好评分者这一目标模糊、可被欺骗或谄媚;再加上"自我保存""掌控环境"这类工具性目标几乎服务于任何其他目标。结论:若能力持续增长,此类行为可能持续加剧,除非重新审视最前沿模型的训练原则。
同期 HN 两条高热度讨论:《经济学人》"Nvidia is the central bank of AI"(420 分、288 评),以及 xeiaso 的 "Everyone should slow down AI development except for me"(230 分、124 评)——指向同一个焦虑:前沿节奏的"降速"讨论正在扩散。(yoshuabengio.org / HN)
8. 极摩客 EVO-X5 Pro:192GB 统一内存,本地流畅跑 300B 大模型
IFA 2026 上,极摩客发布旗舰迷你主机 EVO-X5 Pro,搭载 AMD 锐龙 AI Max+ PRO 495(Zen5,16 核 32 线程,最高 5.2GHz)、RDNA 3.5 的 Radeon 8065S 核显与 55 TOPS 的 XDNA2 NPU,整机算力 131 TOPS。核心亮点是 192GB LPDDR5X-8533 统一内存(带宽 273GB/s),最高 160GB 可动态分配为显存供 GPU 直接调用,省去数据搬运开销。现场用 Qwen3.8-Flash-Next 演示,输出达每秒两位数 token。配备双 USB4 V2、双万兆网口,支持外接显卡坞与多机互联组建分布式集群;2026 年 10 月上市,暂未公布售价。(AIbase)
💡 行业洞见
9. 支付宝 AI 支付体系进化:AI 钱包智能体 + 三大"AI 收"能力
外滩大会上,支付宝宣布 AI 支付从"可支付"迈向"可信支付"。一是推出 AI 钱包智能体,作为用户在智能体世界里的"自己人"——掌握一笔交易的完整上下文,把用户最初意图、预算需求与智能体执行过程、最终交易结果串联起来,完成风险识别并确认符合授权后再执行支付。二是"AI 收"升级,新增三大能力:Vibe Pay(AI 做的网页/小程序被用一次收一次钱)、Skill Pay(一次接入完成 Skill 保护、定价与收款,支持一次性付费或按月订阅)、Machine Pay(Agent 每用一次自动计费,用多少算多少)。
底座是蚂蚁自研的 APASS 商业信任基础设施,基于 KYA(Know Your Agent) 理念,围绕智能体的身份、意图、授权和行为建立全过程信任:可信且符合授权则执行、有疑问则请求用户确认、明确越权则拒绝交易并留下可追溯凭证。数据侧,最近 5 个月智能体代买任务量增长 7 倍,用户月均支付次数增长 3 倍。Visa、Mastercard 与 Alipay+ 正共同探索 KYA 框架互联互通。现场还演示了高德动量机器狗"途途"在授权下完成询价、下单、支付、取货。(AIbase)
10. 支付宝"碰一下"发布无界经营智能体"图图"
9 月 11 日,支付宝"碰一下"发布面向品牌商的无界经营智能体"图图",依托百万级商家侧设备智能体网络,连接 4 亿消费者、百万级门店。图图面向品牌商帮助识别高潜门店、制定活动方案并评估销售效果;此前面向门店的经营智能体"晓雨"则帮商家了解经营状况并执行动作。可口可乐、伊利、玛氏箭牌、农夫山泉、统一、康师傅、三得利、宝洁等已接入,上线超 5000 场品牌活动。案例中玛氏箭牌找到超 10 万个线下潜力售点、触达千万用户;三得利按营销方案一个月多卖 10 万瓶饮料,超半数用户复购。(AIbase)
来源:AIbase、Hacker News、Specific Labs、yoshuabengio.org、DeepSeek、The Economist(经由 HN)