本文详细解析了Qwen3.5模型中的MTP多Token预测技术通过与传统NTP单Token预测的对比阐述了MTP如何提升模型的逻辑规划和推理能力。文章从背景、概念、架构、训练和推理阶段深入剖析了MTP的底层逻辑和精妙机制并探讨了其在实际应用中的优势。MTP技术通过并行生成和验证大幅提升了模型的生成速度同时保持了高质量的输出是大模型领域的一项重要突破。草树知春不久归百般红紫斗芳菲。小伙伴们好我是小窗幽记机器学习的小编卖铁观音的小男孩。不久前Qwen 家族迎来了全面升级Qwen3.5 开放了多个尺寸的模型权重。对于 Qwen3.5 究其技术特点除了此前备受瞩目的 [Gated DeltaNet混合线性注意力机制]另一大核心技术特征便是多Token预测Multi-Token Prediction简称 MTP技术。下面我们将以 Qwen3.5-0.8B 的模型配置config.json:https://huggingface.co/Qwen/Qwen3.5-0.8B/blob/main/config.json为例入手结合 Meta 的顶级学术论文与 DeepSeek-V3/R1 等行业前沿实践 Step by Step 彻底拆解 MTP 技术的底层逻辑与精妙机制。Step 1背景——过去是怎么做的(NTP)要理解 MTP首先要知道传统大模型是怎么生成文本的。过去几乎所有的大模型如 GPT-3、Llama 2使用的都是Next-Token Prediction (NTP单Token预测)。原理 模型读入一段上下文比如输入“我是小窗幽记机器学习的”然后只预测紧接着的下一个词“小编”。接着把“小编”放回句子里变成已知上下文再去预测再下一个词“卖”依此类推。痛点鼠目寸光模型只关注眼前的下一步缺乏长远规划Planning能力容易在复杂逻辑推理或长代码编写中“跑偏”。效率低下为了预测一句话庞大的模型需要反复启动计算每次只蹦出一个词GPU 的显存带宽被严重浪费这就是我们常说的“自回归性能瓶颈”。Step 2概念突破——什么是 MTPMTP多Token预测的核心思想非常直白强迫模型在每一个位置上不要只猜下一个词而是“同时”猜出未来连续的 个词假设模型看到了上文“我是小窗幽记机器学习的”传统模型只输出“小编”。MTP 模型在读到这个位置时直接同时输出“小编”、“卖”、“铁观音”、“的”、“小男孩”。**【关键概念澄清关于“同时生成”】**这里的“同时”到底是指什么是生成时同时抛出还是依次 token-by-token在训练时它是绝对的并行同时生成。在同一个文本位置模型通过挂载的多个预测头一次前向传播就同时计算出未来 个位置的 Token 概率分布。在推理时在起草阶段Drafting轻量级的 MTP 模块可以极速地 token-by-token 写出草稿但在主模型的验证阶段Verifying主模型是一次性读取整段草稿在一次前向传播中同时并行验证多个 Token(每个多一个token的上下文构建一个样本因此本质上是对于一个batch大小的样本执行一次inference)。最终呈现给用户的效果是模型算了一次却同时蹦出了好几个词。Step 3架构揭秘——MTP 模块到底挂在哪里查看 Qwen3.5-0.8B 模型配置(https://huggingface.co/Qwen/Qwen3.5-0.8B/blob/main/config.json)我们可以看到以下关键参数mtp_num_hidden_layers: 1, mtp_use_dedicated_embeddings: false,**1. MTP 的物理位置**MTP 模块是挂在“主干网络Main Backbone的尾部”的。输入数据必须先完整地通过几十层的主干 Transformer 网络主干网络输出最后一个隐藏状态Hidden State后这个状态才会交给额外的 MTP 模块去预测更未来的词。2.mtp_num_hidden_layers: 1是什么意思通用的 MTP如 Meta 的论文可以挂载多个模块。比如挂 3 个模块分别基于主干的输出去预测 、、 这三个未来的词。Qwen3.5 的配置这是一个特定且非常轻量的实现类似 DeepSeek-V3 的做法。它意味着模型在主干尾部只挂载了 1 层额外的 MTP 网络。在这个配置下它实际上做的是双 Token 预测Dual-Token Prediction主干网络预测下一个词第1个词这唯一的 1 层 MTP 模块预测下下个词第2个词。没有更多的模块了。3.mtp_use_dedicated_embeddings: false的奥秘这里的 Dedicated 意思是“专属的、独立的”。false意味着 MTP 模块不使用专属的独立词表映射而是和主模型完全共享同一套词嵌入层Embedding和输出预测头Output Head。这种设计能极大节省显存让模型保持轻量。Step 4训练阶段——榨干数据的价值很多人会问为什么 MTP 在训练时不需要“起草”和“验证” 因为训练时模型手头有“标准答案”Ground Truth所有未来的词都是已知的所以完全不需要靠自己去瞎猜和验证假设真实文本是“我是小窗幽记机器学习的小编卖铁观音的小男孩”。当输入走到“我是小窗幽记机器学习的”时主干网络输出当前状态。模型直接把标准答案“小编”的词向量硬塞给尾部的 MTP 模块。主干网络负责预测“小编”而 MTP 模块则根据标准答案“小编”的提示去预测“卖”。随后模型把这两项预测结果分别与真实答案对比算一下整体误差Loss更新权重。训练威力整个过程是完全并行的。在一个位置上MTP 模型可以同时计算 个词的误差这意味着一份训练数据提供了成倍的纠错信号信号加倍。更重要的是它逼迫模型不能只死记硬背相邻的词而是要为了预测未来好几步去深刻理解全局逻辑。Meta 研究证明这能极大提升模型写代码和做长程逻辑推理的能力。Step 5推理阶段——速度翻倍的魔法 (Speculative Decoding)在推理时即用户提问时我们没有标准答案。现在我们手头只有一个主模型庞大、聪明、算得慢和一个MTP模块轻量、稍微笨点、算得极快。这里用到了一项被称为“推测解码 (Speculative Decoding)”的精妙技术。第一步起草Drafting针对用户的输入“我是小窗幽记机器学习的”MTP 模块或者借助其他轻量级小模型飞速运转先“猜”出了后面连续的 4 个 Token 作为草稿[小编, 卖, 绿茶, 叶]。第二步打包验证Verifying—— 核心验证绝对不是简单的“全盘接受或全盘拒绝”而是从左到右的“最长前缀匹配”部分接收。 主模型不需要算 4 次去验证这 4 个词。它把[小编, 卖, 绿茶, 叶]打包成一个批次Batch分别是已有上下文小编已有上下文小编卖已有上下文小编卖绿茶已有上下文小编卖绿茶叶像平时处理一段已知文本一样一次性、并行地输入到主干网络中看看主模型在这些位置上“本来想输出什么”。我们来模拟主模型的并行计算结果验证第 1 个草稿词小编主模型根据上文输出概率最高的词也是小编。匹配成功验证第 2 个草稿词卖主模型结合前文和“小编”输出概率最高的词是卖。匹配成功验证第 3 个草稿词绿茶主模型结合前文它自己算出来输出概率最高的词是铁观音。匹配失败连锁反应截断一旦第 3 个词错了意味着草稿第 4 个词叶是基于错误的前提绿茶猜出来的。所以从第 3 个词开始后面的草稿全部被废弃拒绝。第三步最终结果在这个例子中主模型接收了前 2 个词小编、卖。同时主模型在验证第 3 个词时已经算出了正确答案铁观音所以这个词也会作为额外赠送直接输出。最终主模型只做了一次前向计算耗时等同于算 1 个词却一口气并列输出了 3 个词[小编, 卖, 铁观音]然后模型基于这 3 个新词继续下一轮的“起草-验证”循环。并行生成补充说明需要特别说明在 Qwen3.5 和 DeepSeek-V3 的架构中起草阶段Drafting的这 4 个 Token 是“逐个生成”Token by Token 串行生成的而不是同时生成的很多人在看 MTP 论文时会被“Multi-Token”这个词误导认为它在推理时也是“唰”地一下同时吐出 4 个词。实际上学术界在 MTP 的推理起草设计上经历过一次从“同时生成”到“逐个生成”的路线修正。我们来对比一下两种门派的做法你就知道为什么 Qwen3.5 必须选择“逐个生成”了。1、路线一Meta 派的“同时生成”Parallel Drafting 在 2024 年 Meta 最初提出 MTP 的论文中他们确实是同时生成的。做法主模型算出一个隐藏状态 后直接分发给 4 个独立的 MTP 预测头。这 4 个头互不通信同时并行猜出第 1、2、3、4 个词。致命缺陷缺乏内部一致性因为是同时猜的MTP 模块 3 在猜“绿茶”的时候根本不知道 MTP 模块 2 猜了“卖”也不知道 MTP 模块 4 猜了“叶”。这会导致草稿的前后逻辑撕裂拼出来的草稿经常是乱码比如拼出[小编, 吃, 绿茶, 树]从而导致主模型在验证时拒绝率极高反而拖慢了速度。2、路线二DeepSeek / Qwen 派的“逐个生成”Sequential Drafting 为了解决草稿胡言乱语的问题DeepSeek-V3 和 Qwen3.5 采用了一种叫做**“保留完整因果链Keep the complete causal chain”**的设计。 在上述例子中起草这 4 个 Token 的真实物理过程是这样的MTP-1接收主模型的状态预测出小编。关键步骤系统把小编这个词变成向量输入给MTP-2。MTP-2 结合前文和“小编”预测出卖。系统再把卖变成向量输入给MTP-3预测出绿茶。系统再把绿茶变成向量输入给MTP-4预测出叶。可以看到它是严格按照 1 - 2 - 3 - 4 的顺序看一步走一步Token by Token生成的。因为后面的词必须依赖前面的词作为已知条件这样写出来的草稿连贯性极强主模型的接受率才能高达 85%~90% 以上。3、终极疑问既然是逐个串行生成的那还能叫“加速”吗凭什么快这正是推测解码Speculative Decoding最巧妙的工程统筹我们来算一笔账。假设我们不外挂 MTP 模块直接让主模型去逐个生成这 4 个词主模型是一个极其庞大的巨兽比如 Qwen 有几十层 TransformerDeepSeek-V3 有 600 多亿激活参数。主模型每走一步生成一个词就要把这几十层重头到尾算一遍。算 4 个词的时间成本 4 × 庞大主模型的单步耗时。现在我们用MTP 模块去逐个起草MTP 模块极其轻量在 Qwen3.5 和 DeepSeek-V3 中一个 MTP 模块通常仅仅是1 层最简单的 Transformer 网络。MTP 写草稿的时间成本 4 × 1层小网络的单步耗时。这个时间相对于主模型来说几乎等于瞬间完成快了数十倍。然后再交由主模型打包验证主模型拿到这段草稿后把它们当作一个已知文本的批次Batch一次性、并行地丢进自己的几十层网络里算一遍。验证的时间成本 1 × 庞大主模型的单步耗时。总结与展望总的来说Qwen3.5 所使用的MTP机制虽然不是一个新技术但依然是一个“一鱼两吃”的神仙级技术对内训练时它是严师逼着模型往后多看几步大幅提升了数据利用率和模型的逻辑规划Planning能力。对外推理时它是自带的涡轮增压器通过“自身推测解码”在不增加硬件负担、不降低输出智商100%无损的前提下让大模型的生成速度翻倍。**目前主流的 MTP 玩家还有谁**放眼整个大模型生态MTP 已经成为新一代 SOTAState-of-the-Art模型的标配。除了Qwen3.5系列Meta在 2024 年发表了开创性的多Token预测论文证实 MTP 可让模型在代码HumanEval和数学任务上的表现飙升 12%~17%推理提速 3 倍。DeepSeek (V3/R1/V3.2)通过类似的mtp_num_hidden_layers: 1双 Token 预测架构搭配无额外显存占用的共享词表机制在千亿参数规模上实现了极致的推理加速。Apple在2025年的论文《Your LLM Knows the Future》中提出通过插入 Mask Token 与门控 LoRA 来激发预训练模型的 MTP 潜力实现了高达 5 倍的推理加速。Xiaomi MiMo-V2-Flash小米在其最新的技术报告中明确采用了 MTP 模块。该模型旨在媲美 DeepSeek-V3通过 MTP 增强了代码能力和逻辑推理效率。GLM在 在 GLM-5 和 GLM-4.5 等最新版本中智谱 AI 引入了共享参数的 MTP 预测机制旨在解决长文本生成时的延迟问题。Kimi在最新的 Kimi 2.5 架构中月之暗面也采用了类似 MTP 的多头预测设计帮助主打长文本的模型更好地学习长距离依赖关系。从 NTP (单词预测) 到 MTP (多词预测)大模型正在努力打破长久以来束缚它的“自回归串行计算瓶颈”。未来随着 MTP 技术的不断演进我们或许会看到模型不仅仅是一次预测几个 Token而是具备一次性生成整个逻辑块Chunk-level Prediction的能力。这将为真正的端侧实时 AI 助手以及具备慢思考能力System 2的高效推理模型铺平最终的道路。2026年AI行业最大的机会毫无疑问就在应用层字节跳动已有7个团队全速布局Agent大模型岗位暴增69%年薪破百万腾讯、京东、百度开放招聘技术岗80%与AI相关……如今超过60%的企业都在推进AI产品落地而真正能交付项目的大模型应用开发工程师****却极度稀缺落地AI应用绝对不是写几个prompt调几个API就能搞定的企业真正需要的是能搞定这三项核心能力的人✅RAG融入外部信息修正模型输出给模型装靠谱大脑✅Agent智能体让AI自主干活通过工具调用Tools环境交互多步推理完成复杂任务。比如做智能客服等等……✅微调针对特定任务优化让模型适配业务目前脉脉上有超过1000家企业发布大模型相关岗位人工智能岗平均月薪7.8w实习生日薪高达4000远超其他行业收入水平技术的稀缺性才是你「值钱」的关键具备AI能力的程序员比传统开发高出不止一截有的人早就转行AI方向拿到百万年薪AI浪潮正在重构程序员的核心竞争力现在入场仍是最佳时机我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】⭐️从大模型微调到AI Agent智能体搭建剖析AI技术的应用场景用实战经验落地AI技术。从GPT到最火的开源模型让你从容面对AI技术革新大模型微调掌握主流大模型如DeepSeek、Qwen等的微调技术针对特定场景优化模型性能。学习如何利用领域数据如制造、医药、金融等进行模型定制提升任务准确性和效率。RAG应用开发深入理解检索增强生成Retrieval-Augmented Generation, RAG技术构建高效的知识检索与生成系统。应用于垂类场景如法律文档分析、医疗诊断辅助、金融报告生成等实现精准信息提取与内容生成。AI Agent智能体搭建学习如何设计和开发AI Agent实现多任务协同、自主决策和复杂问题解决。构建垂类场景下的智能助手如制造业中的设备故障诊断Agent、金融领域的投资分析Agent等。如果你也有以下诉求快速链接产品/业务团队参与前沿项目构建技术壁垒从竞争者中脱颖而出避开35岁裁员危险期顺利拿下高薪岗迭代技术水平延长未来20年的新职业发展……那这节课你一定要来听因为留给普通程序员的时间真的不多了立即扫码即可免费预约「AI技术原理 实战应用 职业发展」「大模型应用开发实战公开课」还有靠谱的内推机会直聘权益完课后赠送大模型应用案例集、AI商业落地白皮书