第12章 语音多模态——Whisper语音识别与TTS合成学习目标掌握Whisper语音识别的架构与实战了解TTS(语音合成)的主流方案认识语音-语言模型的最新进展端到端实战:语音助手应用12.1 语音多模态概述语音多模态涉及三个核心任务:任务英文说明语音识别ASR (Automatic Speech Recognition)语音 → 文本语音合成TTS (Text-to-Speech)文本 → 语音语音理解Speech Understanding语音 → 语义理解12.2 Whisper架构与实战Whisper是OpenAI的通用语音识别模型,支持99种语言。架构