语音 AI
从「Siri 让语音助手进入大众手机」到「字节发布 SeedRealtime 音视频全双工模型」,先抓住起点、路线转向与当前边界,再展开完整事件线。
字节发布 SeedRealtime 音视频全双工模型
字节跳动发布 SeedRealtime:原生音视频全双工大模型,统一端到端架构融合音频、视频与文本,豆包 App 全量上线视频通话;官方称相比级联模型,节奏问题减少约 50%。
腾讯混元发布 Hy ASR 3.0
腾讯混元发布 Hy ASR 3.0 preview,在中文普通话识别上取得进展,官方公布的中文普通话词错率进一步下降。它显示国产语音模型在多语言与口音泛化上持续投入。
OpenAI 发布 GPT-Live 全双工语音模型
OpenAI 发布全双工语音模型 GPT-Live-1 与 GPT-Live-1 mini,让 ChatGPT 语音能同时听与说,支持同声传译、智能垫话与后台委派;两者分别成为付费与免费用户的默认语音模型,并向 iOS、Android 与网页端逐步推送。
Google 发布 Veo 3 原生音频视频
Google 在 I/O 2025 周期发布 Veo 3,强调原生同步音频(对白、音效、环境声)与更强可控性,并逐步接入 Gemini 应用与 API。
GPT-4o 发布
OpenAI 发布 GPT-4o,以同一神经网络处理文本、视觉与音频,让实时语音和视觉交互第一次成为通用模型的原生能力。
讯飞星火发布
科大讯飞发布讯飞星火认知大模型,展示文本生成、知识问答、数学推理与多语种能力,并把大模型与自身语音与教育优势结合。
OpenAI 开源 Whisper 语音识别
OpenAI 发布 Whisper:在约 68 万小时多语、多任务监督音频上训练的端到端语音系统,并开源推理代码与模型权重。官方称在多样数据集上零样本表现更稳健,错误约比专项模型少 50%。
Google Duplex 用 AI 打电话订餐
Google 在 I/O 大会上演示 Duplex:AI 用自然的语气打电话替用户预约理发与餐厅,与真人对话时语气词、停顿都惟妙惟肖。它让「AI 替人打电话」从科幻变成演示,也引发关于透明度的伦理讨论。
DeepMind 发布 WaveNet
DeepMind 公布 WaveNet,一种直接生成原始音频波形的深度生成模型,在英文与中文语音合成中显著提升自然度,被认为大幅缩小了机器语音与人声的差距。
Amazon Echo 与 Alexa 问世
亚马逊发布 Echo 智能音箱与 Alexa 语音助手,把语音交互带进客厅。它验证了「对话式 AI + 硬件」的产品形态,也让语音助手之战从手机蔓延到家庭。
Siri 让语音助手进入大众手机
苹果在 iPhone 4S 发布会上展示 Siri,让语音助手成为智能手机的标配叙事。它把自然语言理解、语音识别与联网服务整合进一个消费者产品。