第九章:多模态训练数据与对齐¶
LLM · 多模态模型 23.4 节已指出"数据质量比模态数量更关键"这一结论,本章展开这句话背后具体的数据收集、过滤与对齐工程;文本对齐技术(RLHF、DPO)的通用原理见 LLM · 训练与对齐,本章只讨论其在多模态场景下的延伸与特有问题。
9.1 数据是能力的主要瓶颈¶
多模态模型的三类典型训练阶段——对比预训练、生成式预训练、指令微调——分别依赖性质完全不同的数据,且规模逐级递减、质量要求逐级提高:
| 阶段 | 数据规模量级 | 数据来源 | 质量要求 |
|---|---|---|---|
| 对比/生成式预训练 | 数亿至数十亿图文对 | 网络爬取 | 大规模但噪声高,依赖自动过滤 |
| 多模态指令微调 | 数万至数百万条指令样本 | 模型生成 + 人工标注/审核 | 需要格式规范、内容准确、覆盖任务多样 |
| 偏好对齐 | 数千至数万条偏好对 | 人工或模型标注的偏好比较 | 高精度,直接决定对齐效果 |
架构设计(第一章)决定了模型"能不能"处理多模态输入,但最终效果的上限主要由这张表里的数据质量和覆盖面决定。
9.2 大规模图文对:来源与噪声¶
网络爬取的图文对(图像 + alt text、周边文本)是预训练阶段的主要数据来源,LAION-5B 是这一类公开数据集的代表——从 Common Crawl 中提取图像及其关联文本,并用 CLIP 相似度对图文对做初步过滤。这类数据的核心问题是噪声:alt text 经常是无关描述、SEO 关键词堆砌或与图像内容完全不匹配的文本,直接使用未经过滤的原始爬取数据训练出的模型,图文对齐质量和文本遵循能力都会明显下降。
9.3 数据质量过滤与合成描述¶
提升预训练数据质量的常见做法包括:
- 相似度过滤:用 CLIP 一类图文相似度模型给每个图文对打分,剔除低相似度样本,减少图文不匹配的比例;
- 去重:网络爬取数据中大量重复或近似重复的图像/文本会造成数据分布偏斜,需要在图像特征和文本层面分别去重;
- 合成/重新生成描述:alt text 质量参差不齐的问题也可以从"重新生成描述"入手——DALL·E 3 的技术报告提出用专门训练的图像描述模型为训练图像重新生成更详细、更准确的描述,替换原始网络文本,作者报告这一步显著提升了最终模型对文本提示的遵循能力(见 第七章 7.6 节);
- 安全与合规过滤:剔除包含儿童性虐待材料(CSAM)、非自愿隐私内容等违法或高风险内容,以及在许可与版权允许范围之外的素材,这一步不是可选项,而是数据管线中不可缺失的合规前置环节。
9.4 多模态指令微调数据的构建¶
预训练阶段学到的是"图文如何关联",指令微调阶段要教会模型"如何按人类期望的格式回答问题、遵循指令、引用图像证据"。LLaVA 展示了一种规模化构建指令数据的思路:用纯文本大模型(如 GPT-4),基于图像的结构化标注(物体框、描述、区域说明)生成对话式的问答、详细描述和复杂推理样本,而不依赖大规模人工标注——语言模型看不到图像本身,只能依据结构化的文本标注"想象"合理的问答内容,这类合成数据的质量因此直接受限于原始标注的完整性和准确性。
纯模型生成的指令数据存在放大标注偏差、生成不准确细节等风险,生产级别的指令微调集通常还需要人工审核抽样、针对已知薄弱任务(如计数、空间关系、OCR)补充专门标注数据,而不能完全依赖自动生成管线。
9.5 交错图文数据与上下文学习能力¶
指令微调关注"单轮问答",但多模态模型的上下文学习能力(在一次对话里给出多个图文示例,模型据此类推)依赖另一类数据:交错图文文档(Interleaved Image-Text Documents)——保留网页、文章中图片与文字自然穿插出现的原始顺序和上下文关系,而不是把图文拆成独立的成对样本。Flamingo 的训练数据中包含专门构建的交错网页数据集;OBELICS 是这类数据集的公开代表,通过对 Common Crawl 网页做结构化解析,抽取并保留图文交错的原始文档结构。这类数据让模型在训练阶段就见过"多图多文混排、需要跨图文关联理解"的样本分布,是模型具备多图推理和少样本上下文学习能力的重要前提,仅靠成对的图文数据难以覆盖这类分布。
9.6 多模态偏好对齐¶
文本领域的 RLHF/DPO(见 LLM · 训练与对齐)同样被扩展到多模态场景,但多模态偏好数据要额外解决幻觉降权问题:模型描述图像时可能生成语法通顺但与图像内容不符的细节(如描述图中不存在的物体),单纯基于"哪个回答更详细/更流畅"收集的偏好数据无法抑制这类幻觉,反而可能因为更详细的回答更"像模型认为的好答案"而被优先选择。LLaVA-RLHF 一类工作提出用事实增强的方式构建奖励信号——引入图像的结构化标注作为事实校验的参照,让奖励模型能够识别并惩罚与图像内容矛盾的生成内容,而不仅依赖标注者的主观偏好判断。
9.7 常见错误¶
9.7.1 只看数据规模,不看图文匹配质量¶
大规模但低质量过滤的图文对数据集,训练出的模型在图文对齐和指令遵循上的表现,通常不如规模小一个数量级但经过严格相似度过滤和去重的数据集,数据管线的过滤环节投入往往比单纯扩大爬取规模更具性价比。
9.7.2 用纯成对图文数据覆盖多图/上下文学习能力需求¶
如果训练数据里没有交错图文文档,模型很难具备可靠的多图推理和少样本上下文学习能力,即使成对图文数据规模很大,也无法替代交错文档提供的跨图文关联分布(见 9.5 节)。
9.7.3 用通用偏好数据直接做多模态对齐¶
直接套用文本领域"哪个回答更详细/更有帮助"的偏好标注标准,容易鼓励模型生成更长但包含虚构细节的回答,多模态偏好数据采集应显式加入事实一致性校验(见 9.6 节)。
9.8 本章总结¶
- 多模态训练分预训练、指令微调、偏好对齐三个阶段,数据规模递减、质量要求递增,是能力上限的主要决定因素;
- 大规模图文对普遍存在噪声,相似度过滤、去重、合成/重新生成描述和安全合规过滤是必要的数据处理步骤;
- 多模态指令微调数据可通过纯文本模型基于结构化标注合成生成,但需要人工审核和针对薄弱任务的专门补充;
- 交错图文文档是模型获得多图推理和上下文学习能力的关键数据类型,无法被成对图文数据替代;
- 多模态偏好对齐需要显式的事实一致性校验,以避免奖励模型鼓励更详细但存在幻觉的回答。
多模态训练里最值得花力气的地方,通常不是再多爬一点数据,而是把图文匹配、交错文档和事实校验做好。
参考资料¶
- LAION-5B: An Open Large-Scale Dataset for Training Next Generation Image-Text Models
- OpenAI DALL·E 3: Improving Image Generation with Better Captions
- LLaVA: Visual Instruction Tuning
- Flamingo: a Visual Language Model for Few-Shot Learning
- OBELICS: An Open Web-Scale Filtered Dataset of Interleaved Image-Text Documents
- Aligning Large Multimodal Models with Factually Augmented RLHF (LLaVA-RLHF)