← Back to ai-frontier

"2026-09-16 AI 前沿速递"

📌 头条

1. Google 官宣 Gemini 3.8 Live:首创低延迟语音流"边说边想"

Google 正式公布原生端到端语音交互的最新突破,推出实时语音大模型 Gemini 3.8 Live 及面向高难度任务的 Gemini 3.8 Live Extended Thinking。

  • Gemini 3.8 Live:优化极速对话与流式交互,语调起伏更敏锐、支持自然打断与上下文理解,主打人类级质感的实时语音交流。
  • Extended Thinking:赋予模型"边说边想"的后台扩展推理能力——维持实时连贯对话的同时,在后台并发执行多步逻辑拆解、代码排错或技术诊断,无需中断对话节奏。
  • 应用场景:实时步骤排错、复杂数理推导、实时外语同声辅导、多任务流式指令执行;据称在多项多模态与语音推理基准评测中位居榜首。
  • 开放方式:即日起通过官方 API 及开发工作台开放接入,可用于智能硬件、客服、实时编程辅助及协同办公等全双工语音代理服务。(AIbase / Google Blog / Hacker News)

2. 苹果 iPhone 18 Pro 引入 Reference Image:按下快门即硬件签名,对抗 AI 伪造图片

苹果 9 月 15 日发布博文,介绍在 iPhone 18 Pro / Pro Max 上引入的 Apple Reference Image(可选 Reference mode)功能:

  • 拍时签名:用户按下快门后,系统在 SEP(安全隔区) 内对焦段、数字变焦等关键元数据签名,形成不可伪造的"数字负片";相比传统"拍后编辑再签名"的证据系统,更难篡改。
  • 可验证时间戳:系统提供拍摄时间下界与上界,并通过加密时间戳服务嵌入参考图像。
  • 全链路防篡改:配合 Private Cloud Compute 的验证链,在保护用户隐私、不暴露个人信息的前提下确保端到端不可篡改。
  • 用途:面向新闻机构、证据留存等需要可信图像来源的场合,提供"真实来源"证据链。(Apple Security Blog / AIbase / Hacker News)

3. OpenAI 估值冲刺 1.2 万亿美元,IPO 拟推迟至 2027 年

OpenAI 正与投资者展开新一轮私人融资洽谈,目标估值高达 1.2 万亿美元,较今年 3 月 1220 亿美元融资确立的 8520 亿美元投后估值大幅跃升。

  • 上市节奏:顾问曾探讨最早第三季度上市并接受较低估值,但公司倾向推迟至 2027 年;CEO 奥特曼明确将 1 万亿美元视为上市底线门槛。
  • 资本结构:微软投入超 130 亿美元持股约 27%;英伟达以算力额度形式投入约 300 亿美元(非纯现金);软银 400 亿美元过桥贷款锚定,亚马逊 500 亿美元锚定投资与上市/AGI 里程碑挂钩。
  • 基本面:截至 2026 年 2 月年化收入约 250 亿美元(同比 +92%),Q1 收入 57 亿美元,全年朝 300 亿美元目标迈进;企业业务收入占比超 40%。但 Q1 营业亏损约 93 亿美元、Q2 扩大至约 123 亿美元,全年运营亏损预计 270—330 亿美元;推理成本 2026 年攀升至 141 亿美元。毛利率从约 33% 提升至约 39%,但利润被迅速再投入产能与研究。
  • 竞争压力:ChatGPT 周活 9 亿、月活超 10 亿;但 Sensor Tower 数据显示其全球 AI 助手份额 5 月跌破 50% 至约 46%,Anthropic 在企业级 API 支出上实现反超。按当前营收计市销率约 40 倍,巨额亏损与高倍数定价形成张力。(AIbase)

4. OpenAI 宣布 GPT-5.5 于 10 月 14 日下线

OpenAI 9 月 16 日宣布,GPT-5.5 将于 10 月 14 日从 ChatGPT、ChatGPT Work 和 Codex 中下线,覆盖所有订阅方案。官方提醒 Codex 用户尽快切换至 GPT-5.6 Sol 或 GPT-6 Astra。(AIbase)

🧠 技术趋势(模型 / 开源 / 生态)

5. Salesforce 联手英伟达发布推理大模型 Koa:开源权重路线,向闭源巨头宣战

在 Dreamforce 大会,Salesforce 发布首款推理大模型 Koa:

  • 底座:基于英伟达开源权重的 Nemotron 打造,双方联合微调,深度赋能销售、市场、客服等企业核心场景。
  • 数据合规:整个训练过程未摄入任何真实客户数据(采用完全自主生成的模拟业务合成数据集,模拟客服投诉、销售推进等复杂场景),规避向闭源模型上传内部文件/代码/提示词的数据安全与合规风险。
  • 成本优势:执行同等业务任务时消耗 Token 大幅减少,配合 AI 网关自动调度路由灵活分发请求;安全机制内嵌于 Salesforce 平台内部。
  • 生态:Salesforce 未放弃多元合作,近期与 Anthropic 达成 ClaudeForce 项目,允许企业以 Claude 作为 AI 交互前端,核心业务数据仍留在 Salesforce 记录系统内。(AIbase)

6. 阶跃星辰发布 StepAudio 3 系列:五款语音大模型,多项登顶全球第一

阶跃星辰 9 月 15 日正式发布 StepAudio 3 系列语音大模型,包含 Realtime、ASR、TTS、Gen、Music 五款,多款在 Artificial Analysis 榜单登顶:

  • StepAudio3 Realtime:全双工原生实时对话,在 Conversational Dynamics 榜以 98.9% 夺全球第一,语音推理准确率 99.7% 位列 Speech Reasoning 榜第一;支持语义/语气/情绪/副语言/环境声综合理解,推理与语音生成并行,工具调用与长任务异步执行。
  • StepAudio3 ASR:非流式识别词错误率(WER)仅 1.7%,并列全球第一;支持中英方言、中英混说、长音频及医疗、法律、金融、汽车、编程等专业领域,能应对低声、快语速、含糊连读、歌声与背景音乐。
  • StepAudio3 TTS:真人级语音生成,还原笑声、迟疑、结巴、重复、改口等副语言表现,流式生成与播放同步。
  • StepAudio3 Gen:自然语言 + 参考音频一次性统一生成人声、音效、环境音与背景音乐,支持精细控制与时间/顺序编排。
  • StepAudio3 Music:支持从零生成及基于 ABC 记谱法的多轮交互创作,清唱即可自动补齐和声、节奏、乐器与完整编曲。五款模型已在阶跃星辰开放平台全面上线。(AIbase)

7. TypeSafe AI 发布 System One 模型 Jev:快两个数量级,且不会幻觉

OpenAI 前研究员、TypeSafe AI 创始人 Diogo Almeida 宣布发布首个 System One Model——面向自动化、让软件直接消费的"快速结构化决策"新一类前沿模型:

  • 定位:"frontier-intelligence function call"——非结构化状态输入,类型化概率决策输出。放弃字符串生成,专为结构化输出优化,不会幻觉。
  • 技术栈:全新模型架构 + 并行采样器 + 名为 RLCD(Reinforcement Learning for Calibrated Decisions)的训练方法,追求最高效率。
  • 性能:在 System One 任务上智能水平与现有 LLM 相近,但快两个数量级、更高效。
  • 背景:作者称在 OpenAI 参与构建了让语言模型"有用"的指令跟随与人机对话方法(即 ChatGPT 背后的研究),但认为聊天模型通往 AGI 仍缺了关键一环;经过两年隐身研发后推出。Jev 今日早期访问开放。(TypeSafe AI Blog / Hacker News)

8. Meta 推出 Meta One 订阅:最高 499 美元,AI 能力深度绑定社交订阅

Meta 周二推出全新订阅服务 Meta One,为 Facebook、Instagram、WhatsApp 用户提供更丰富的 AI 功能:

  • 个人套餐:核心版 7.99 美元/月、高级版 19.99 美元/月,均含 Facebook Plus / Instagram Plus / WhatsApp Plus 权益;支持 Muse Image、Muse Video 生成图片与视频,Instagram 内 AI 驱动的 Restyle 工具,额度随国家、场景、系统条件变化。
  • 企业与创作者:基础、高级、Expert、Max 四档,起价 14.99 / 49.99 / 149 / 499 美元,覆盖 Meta Business Agent、数据分析、受众洞察、团队协作、商业广播等,并计划加入营销、业务运营、内容创作 AI 能力;Edits 将推 Edits Plus(云存储 + AI 助手)。
  • 商业化信号:Appfigures 数据显示截至 9 月 9 日当周,Instagram 全球日均订阅收入 120 万美元(周增 475%),Facebook 为 52.8 万美元(周增 143%)。(AIbase)

💡 行业洞见

9. vivo 蓝心大模型全面升级:四大模型齐发,端云协同做"手机任务中控"

在 2026 vivo 开发者大会上,vivo 宣布蓝心大模型全面升级,发布四款核心模型:

  • Blue LM-RealTime:端到端语音理解架构,嘈杂环境、轻声、口音、连续表达、中英混说均可识别。
  • Blue LM-Nano:端侧大模型,实时感知并沉淀个人记忆,融合屏幕内容、图像、视频、文本、文件,长期记录使用习惯、偏好、设备状态与时空场景,vivo 称多项榜单第一。
  • Blue LM-Flash / Blue LM-Pro:云侧大模型,通过自研 Agentic 引擎与系统级 Harness 协同充当手机任务中控,用户说需求即可跨设备、跨应用、跨场景调用能力执行任务,并能根据用户修正持续学习。(AIbase)

10. 华为小艺 Work 开启内测:人离开电脑,任务继续跑

华为 9 月 16 日宣布 小艺 Work 开启内测,定位面向日常办公、代码开发、创意创作的 AI 工作助理,支持鸿蒙手机、平板和电脑(Windows 客户端版本号 0.6.9):

  • 自主执行:接收目标后自主拆解任务、调用工具并推进执行,进度可查看、关键节点由用户审核。
  • 跨端协同:移动设备可远程下发任务、查看进度并验收结果,执行环境可选云电脑或本地电脑,并支持同时连接多台电脑。
  • 会员机制:AI 点数按任务复杂度差异化消耗;付费会员失效后数据保留 7 天,免费会员失效后数据立即删除。备案信息显示涉及 DeepSeek、华为云盘古 NLP、MiniMax、智谱及月之暗面 Moonshot 等算法。(AIbase)

11. "暂停 AI"之争再升级:加拿大研究员呼吁无限期暂停前沿研发

  • 蒙特利尔大学 AI 助理教授、Mila 核心学术成员 David Krueger(研究方向为"降低 AI 导致人类灭绝的风险",非营利机构 Evitable 创始人)表示:"我们需要立即、无限期暂停前沿 AI 的研发。我们现在就必须停止研发能力更强的 AI。"他认为仅"放缓"远远不够,且当前方案力度不足、推进太慢。
  • 关键警告:他认为测试已基本失效——"随着 AI 愈发智能,测试可信度会持续下降,因为 AI 具备伪装能力,可以表现得循规蹈矩,也可以刻意装傻,骗过我们的测试。"
  • 背景:此前 Anthropic CEO Amodei 发文呼吁放缓 AI 研发,获 OpenAI 奥特曼与马斯克支持;Krueger 称"呼吁放缓值得肯定",但不认同具体方案。(AIbase)

12. 中文互联网基础语料 4.0 发布:120GB 高质量可信数据上线

9 月 15 日,2026 国家网络安全宣传周人工智能安全治理分论坛上,中文互联网基础语料 4.0 正式发布并上线"中文互联网语料资源平台",数据总量达 120GB。在中央网信办指导下,中国网络安全协会联合国家互联网应急中心,会同百度、中科闻歌、开普云、拓尔思、科大讯飞、知乎等单位共建。有需求用户可通过协会官网注册认证后下载。(AIbase)

13. 惠普发布 ZBook Ultra G3a 16:192GB 统一内存,本地跑 300B 大模型

惠普发布移动工作站新品 ZBook Ultra G3a 16:基于 AMD 锐龙 AI Max PRO 400 "Gorgon Halo" 处理器,最高 192GB 统一内存、其中 160GB 可分配为独立显存,可在本地流畅运行高达 300B 参数大模型。整机起始约 1.9 千克、厚 17.9mm,100W 性能释放,可选 5G;预装 Perplexity Computer 本地智能体,适配 Autodesk Revit 2027、3ds Max、Chaos Enscape。计划 2026 年 10 月上市,标价 7499 美元(约合 50108 元)。(AIbase)


数据来源:AIbase、Google Blog、Apple Security Blog、TypeSafe AI Blog、Hacker News、Dreamforce、vivo 开发者大会、飞书/华为官网。本期为 2026-09-16 汇总;涉及传闻/未官宣类信息已标注,待官方确认。