这篇文章讲了什么一句话如何让大模型在超长文本里“找重点”并用更好的数据做DPO训练作者提出用“多臂老虎机Multi-Armed Bandit”来挑选最有用的上下文片段chunk再用这些片段生成更高质量的偏好数据。❗现存的核心问题当前LLM在长文本里有个经典问题Lost-in-the-Middle中间信息丢失模型重视开头 ✅重视结尾 ✅忽略中间 ❌同时SFT → 容易过拟合DPO → 数据质量强依赖采样 所以问题变成如何采样“更有信息量”的上下文生成更好的DPO训练数据方法LongMab-PO作者提出LongMab-PO MAB Chunk Sampling DPO核心思路拆解Step 1切分上下文把长文本拆成多个 chunkC → {C1, C2, ..., Cn}Step 2把chunk当“老虎机臂” 每个chunk 一个“arm”目标找出“最有用”的chunk组合Step 3用UCB策略选chunk核心公式不用细看 平衡探索没试过的chunk利用效果好的chunkStep 4生成答案 打分每轮用选中的chunk → 生成回答用指标打分SubEM F1Step 5更新chunk价值 哪些chunk贡献了好答案 → 权重↑ 没用的 → 权重↓Step 6构造DPO数据最终得到(y, y-) 偏好对用于训练模型一句话总结先动态选上下文 → 再生成更优回答 → 再做DPO优化图1展示整体流程 长文本 → 切chunk → MAB选chunk → 生成答案 → 做DPO关键点chunk不是一次选死而是多轮试探 更新 类似“边试边学”干中学图2是核心创新 不再一次性喂整个长文本而是让模型像“刷题一样”反复试不同片段 每次试都会知道哪些内容有用 同时自动生成“好答案 vs 坏答案”直接用来做DPO训练。本质上它把❌ 静态长文本理解 变成了✅ 动态探索 反馈学习以下是详细过程 ① 初始化先给每个文本片段打个“价值分” 上半部分输入Query问题Context超长文档做的事1️⃣ 把长文本切成很多 chunkC₁, C₂, … Cₙ2️⃣ 用 embedding 相似度初始化每个 chunk 的分数 μᵢ 可以理解为“先猜一下哪些段落可能有用”⚠️问题 embedding 很粗糙经常不准相关 ≠ 有用 ② 核心MAB rollout整篇最关键 左下角这一块在干嘛循环做这几步Step 1️⃣选 chunkUCB策略有用的 多选没用的 少选但也会“探索新chunk” 核心思想探索 利用explore vs exploitStep 2️⃣喂给 LLM 生成答案Query 选中的 chunk → LLM → 生成答案 ŷStep 3️⃣判断这个 chunk 好不好根据答案对不对chunk 是否贡献了信息 更新 μᵢ奖励Step 4️⃣继续循环 越选越准有用 chunk 分数 ↑垃圾 chunk 分数 ↓关键理解非常重要图里这句话其实就是精髓✔ 有用但没被选过 → 鼓励❌ 没用但老被选 → 惩罚 ③ 顺便干一件大事构造DPO数据 右边绿色框每次 rollout 会产生好答案 ✅坏答案 ❌比如✅ Five Colleges对❌ Trinity College错然后做 构造 preference pair(好答案, 坏答案)用来训练 DPO偏好优化关键点数据不是人工标的是“rollout自动产生的”重点1直接看 Avg最关键LLaMA-3.1-8BVanilla33.23 / 41.03LongMab-PO40.95 / 47.43最高 提升非常明显SubEM 7.7F1 6.4Qwen-2.5-7BVanilla32.03 / 33.29LongMab-PO37.06 / 42.26最高 同样是大幅提升重点2对比不同方法❌ SFT方法LongAlpaca / LongAlign 结论有时候还不如原始模型比如LongAlign Avg F1 39.34 Vanilla 41.03 说明单纯喂数据SFT并不能解决长上下文问题⚖️ DPO方法LongReward / SeaLong / LongFaith 有提升但不稳定不全面例如LongFaith 在 MuSiQue 很强但在 NarrativeQA 直接崩9.50 问题数据质量不稳定✅ LongMab-PO 特点所有任务都强没明显短板平均最好 说明关键不是DPO本身而是“你怎么生成DPO数据”重点3跨任务稳定性看5个数据集MuSiQue多跳推理2Wiki跨文档MFQA开放问答NarrativeQA长故事FakebookQA超长 LongMab-PO每个任务都在前列没“翻车任务” 这点很关键泛化能力强这篇文章的亮点⭐亮点1把“上下文选择”变成学习问题以前 靠相似度静态现在用bandit动态学习⭐亮点2直接优化“数据质量”不是 改模型结构而是让训练数据更聪明⭐亮点3解决长上下文核心痛点 Lost-in-the-middle通过逐步找到“真正有用的chunk”一句话总结LongMab-PO 用多臂老虎机动态选择上下文提升DPO数据质量从而显著增强LLM的长文本推理能力。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】