【大模型】大白话讲透:多模态大模型的原理、发展史与格局
从“为什么需要编码器”到“图片语音怎么转成向量”一次讲透。一、多模态为什么需要编码器答案必须需要而且每种模态都有自己的编码器核心逻辑大模型只认识向量不认识图片、语音、视频。所以每种模态都需要一个“翻译官”把原始信号转成模型能处理的向量。模态原始输入编码方式输出文本文字Tokenizer 查表得到 Embeddingtoken 向量序列图片像素矩阵切 Patch 线性投影 / CNN 特征提取patch 向量序列语音波形信号分帧 梅尔频谱 投影 / 音频编码器音频帧向量序列视频连续帧抽帧 每帧图片编码 帧位置编码帧向量序列术语说明严格来说“Embedding”通常特指离散符号如 token到稠密向量的映射查表操作。对于图片、语音等连续信号更准确的术语是编码器Encoder或特征提取器。ViT 对图片的操作是“编码”Whisper 对语音的操作也是“编码”。下文统一用“编码器”指代各模态的信号转换模块仅在文本场景保留“Embedding”一词。大白话类比人的感官眼睛看到图片 → 视网膜转成神经信号 → 大脑处理耳朵听到语音 → 耳蜗转成神经信号 → 大脑处理嘴巴说出文字 → 也是神经信号 → 大脑处理更精确的对应关系是摄像头/麦克风 → 模态编码器视网膜/耳蜗如 ViT/Conformer → 投影层视神经/听神经 → LLM 基座大脑皮层每种感官都有自己的“转换器”编码器把不同的外界信号统一转成大脑能理解的神经信号向量。多模态模型就是这个道理。多模态编码的特殊挑战文本的 Embedding 是“查表”离散 token → 向量但图片/语音是连续信号不能直接查表需要先“切分 编码”。这是和文本最大的不同。二、图片、语音、视频模型怎么生成输入向量1. 图片从像素到 Patch 向量主流方案ViTVision Transformer图片(224×224×3) → 切成 16×16 的小方块(Patch) → 196 个 Patch → 每个 Patch 展平成一维向量(16×16×3768维) → 通过线性投影层映射到模型维度(比如 1024 维) → 加上位置编码 → 196 个向量序列送入 Transformer说明展平flatten和线性投影linear projection是 ViT 的两个连续步骤先将每个 patch 的像素拉平再用一个可训练的线性层映射到 Transformer 的隐藏维度。类比把一张大图片切成 196 块小拼图每块拼图转成一个“描述向量”然后把这 196 个描述向量当成 196 个“词”送给大模型处理。传统方案CNN卷积神经网络用多层卷积提取特征最后得到特征图再拉平或池化成向量序列现在逐渐被 ViT 取代但 ResNet 系列仍在很多工程场景中作为 baseline如目标检测、特征提取CLIP 早期版本用过 ResNet-50/101但主流实现已经是 ViTViT-B/32、ViT-L/142. 语音从波形到帧向量主流方案语音波形(16kHz采样) → 分帧(每帧 25ms帧移 10ms) → 提取梅尔频谱(Mel Spectrogram) → 用卷积或线性投影成向量 → 加上位置编码 → 向量序列送入 Transformer/Conformer类比语音是一条连续的波浪线把它切成一小段一小段帧每段提取一个“声音特征向量”然后把这些向量当成“词”序列处理。代表模型WhisperOpenAI编码器-解码器结构多语言语音识别的奠基性开源模型使用 68 万小时数据训练。但中文场景下已被 SenseVoice、Paraformer、Qwen3-ASR 等超越。Conformer语音识别主流架构结合 CNN 和 Transformer。3. 视频从连续帧到时序向量主流方案视频 → 按帧率抽帧(比如每秒 2 帧) → 每帧用图片编码器(ViT)转成向量 → 加上帧位置编码(标记这是第几帧) → 帧向量序列送入 Transformer更高级的方案直接在时空维度做 3D Patch同时切空间和时间比如 Video Transformer。类比视频就是一帧一帧的图片先把每帧转成向量再告诉模型“这是第 1 帧、这是第 2 帧”模型就能理解时间顺序。4. 一个关键设计所有模态都转成“向量序列”不管输入是什么最终都经过各模态编码器输出向量序列再通过投影层映射到统一的维度变成统一格式N 个向量每个向量维度相同 → 可以拼接、可以交叉注意力、可以融合这就是多模态能融合的基础——不同模态在向量空间里是统一的。三、多模态模型和文本模型有什么不同维度文本模型多模态模型输入离散 token文字图片像素、语音波形、视频帧连续信号入口Tokenizer Embedding 查表模态编码器ViT/CNN/Conformer序列长度几千~几十万 token长上下文模型已达百万级较长图片 196 patch语音上千帧视频上万核心挑战语言理解与生成跨模态对齐 各模态理解训练数据纯文本图文对、音文对、视频字幕等计算量相对可控更大图片/视频编码贵序列长评估相对成熟困难生成质量难量化最本质的不同跨模态对齐文本模型只需要理解语言本身。多模态模型额外需要解决“猫”这个词和一张猫的图片在向量空间里怎么对应起来这就是跨模态对齐——多模态最核心、最难的问题。四、多模态会用哪些训练数据1. 图文对最主要图片 人工描述 / alt 文本代表数据集LAION-5B约 58.5 亿图文对其中 23.2 亿为英文、COCO、Conceptual Captions用途学习图文对齐、视觉理解2. 视频 字幕/描述短视频 自动字幕代表数据集WebVid、YouTube 视频用途视频理解、时序建模3. 语音 文本语音录音 转写文本代表数据集LibriSpeech、CommonVoice、Whisper 训练数据68 万小时用途语音识别、语音理解4. 纯文本和文本模型一样的海量文本头部模型已达十几万亿 token 量级用途保持语言能力多模态模型通常先有文本基座5. 纯图片/视频/语音自监督没有文本标注只有原始信号用掩码重建、对比学习等方法自监督预训练用途学习模态内的特征表示6. 指令微调数据多模态对话图片问题→回答图文问答VQA语音对话用途让模型学会用自然语言和人类交互数据量对比模态典型数据量特点纯文本万亿~十几万亿 token密度高占空间小图文对几十亿对图片占空间大描述质量参差语音几十万小时压缩后约几十到上百 MB/小时未压缩约 100MB/小时视频几百万小时极其占空间处理贵五、多模态 vs 文本数据、参数、算力差多少1. 数据差异文本模型训练数据就是纯文本密度高处理简单多模态模型训练数据是图文对/视频/语音单条数据占空间大预处理复杂图片要切 patch、语音要分帧多模态的有效信息密度更低一张图片可能只有一句话的信息量但占的空间是文本的几百倍2. 参数量级差异多模态模型通常是“大文本基座 小模态编码器”的结构组件典型参数量说明文本基座LLM7B~70B负责语言理解和生成是主体视觉编码器ViT300M~2B负责图片编码比 LLM 小很多语音编码器100M~1B负责语音编码投影/对齐层几 M~几十 M把模态特征映射到 LLM 空间总计比同级别文本模型大约大 5%~30%经验估计因模型而异主要大在编码器例子LLaVA-7B约 7BLLM 0.3BViT-L/14 7.3B约大 4%使用 ViT-g/14约 1.8B的模型则比同级别文本模型大约 25%GPT-4V估计文本基座几十 B 视觉编码器几 BQwen-VL-7B约 7B 视觉编码器3. 训练计算量差异多模态训练计算量通常是同级别文本模型的2~5 倍经验估计因模型而异主要原因有二一是视觉编码器的前向计算ViT 处理图片二是图片/视频带来的更长序列导致注意力计算 O(n²) 显著增加视频训练尤其贵所以视频大模型参数通常比纯文本模型小典型多模态训练策略多数多模态模型采用两阶段训练对齐预训练冻结 LLM 和视觉编码器的大部分参数只训练投影层让图片向量进入 LLM 的语义空间。指令微调解冻更多参数使用图文对话、VQA 等数据让模型学会遵循指令、回答问题。这样做可以大幅节省训练成本同时保持语言能力不退化。六、多模态是同样的处理架构吗核心都是 Transformer但编码器和融合方式不同1. 各自有编码器文本Tokenizer Embedding Transformer图片ViT / CNN语音Conformer / Transformer视频Video ViT / 帧级 ViT 时序编码2. 三种融合架构架构 A早期融合输入层拼接—— “拼到一起再处理”图片向量 文本向量 → 拼接成一个序列 → 一起送入 Transformer代表FLAVA、ViLBERT优点模态交互充分缺点序列长计算贵架构 B中期融合Cross-Attention—— “一边看一边处理”图片编码器 → 图片特征 文本 Transformer → 用 cross-attention 关注图片特征代表Flamingo、BLIP、BLIP-2优点计算效率高模态交互灵活缺点实现复杂架构 C晚期融合各自编码后拼接—— “各自处理完再合并”图片编码器 → 图片向量单个 文本编码器 → 文本向量单个 → 拼接 → 分类/生成代表CLIP对比学习优点简单高效缺点交互不充分不适合复杂生成3. 现在主流模态编码器 LLM 基座图片 → ViT 编码 → 投影层 → 映射成“虚拟 token” → 和文本 token 拼接 → 送入 LLM代表LLaVA、Qwen-VL、GPT-4V思路把图片转成“虚拟文字”然后就和纯文本模型一样处理优点复用成熟的 LLM 能力训练效率高这是目前最主流的架构4. 重要演进拼接式 → 原生多模态2024—2026 年最重要的架构主线是从“拼接式”到“原生多模态”拼接式2022—2023先训好 LLM再外挂视觉编码器用投影层拼接LLaVA、Qwen-VL。原生多模态2024—从预训练阶段就混合所有模态数据模型“天生”会看会听。例如 Qwen3-Omni 通过早期以文本为核心的预训练和混合多模态训练获得原生多模态能力在实现强大音视频性能的同时单模态文本与图像效果不降。这条线比“三种融合架构”更能解释当下格局。七、多模态大模型训练时学习的是什么1. 模态内理解图片识别物体、场景、文字、关系语音识别音素、词语、情感视频理解动作、事件、时序类比先学会“用眼睛看”“用耳朵听”2. 跨模态对齐最核心核心是对比学习把“猫”这个词的向量和猫的图片特征向量拉近正样本对同时把“猫”和狗的图片特征推远负样本对通过大量这样的正负样本对比模型学会了图文之间的语义对应关系这就是 CLIP 的对比学习做的事类比学会“看到猫的图片脑子里想到‘猫’这个词”3. 跨模态推理给一张图片回答关于图片的问题给一段语音转写成文字给一段视频总结内容类比学会“看图说话”“听写”4. 统一语义空间理想目标不同模态在同一个向量空间里语义相似的东西向量接近在全模态模型的理想目标中一张猫的图片、“猫”这个词、猫叫的语音三者向量接近但目前大多数模型只做到了图文对齐音文对齐仍是难点这样模型才能跨模态理解和生成八、多模态有哪些难点1. 跨模态对齐难图片是二维空间信息文本是一维序列怎么对应一张图可能对应很多种描述哪个是“正确”的对齐细粒度对齐难图片里的某个物体对应句子里的哪个词2. 计算成本高图片/视频/语音编码比文本贵得多视频尤其贵一秒视频 24 帧每帧都要编码训练成本是文本模型的几倍到几十倍3. 数据质量参差图文对的描述很多是自动抓取的 alt 文本质量差、噪声大视频字幕很多是自动生成的错误多高质量多模态标注数据稀缺且昂贵4. 序列长度问题图片切成 patch 后有几百个 token语音分帧后有上千个 token视频更是成千上万注意力计算 O(n²)长序列扛不住5. 模态不平衡文本能力很强LLM 已经很成熟视觉/语音能力相对弱模型容易“偏科”语言流畅但图片理解错根本原因训练数据不平衡——文本数据量远大于图文对数据量且 LLM 基座参数量远大于视觉编码器模型倾向于“过度依赖语言先验”忽视视觉信号6. 幻觉问题图片理解错了但生成的文本很流畅看起来像真的比如图片里是猫模型生成“这是一只狗”但语气很确定比纯文本幻觉更难发现7. 评估困难文本生成有相对成熟的评估指标图片理解、视频描述的质量很难量化很多时候需要人工评估8. 多模态推理成本高新增一张图编码后可能产生几百到几千个 token一分钟视频可能上万 token直接撑爆上下文窗口和账单视觉 token 压缩如 Qwen-VL 的动态分辨率、InternVL 的视觉分辨率路由成为近两年的重要研究方向九、多模态发展史与演变第一阶段2018 年以前单模态各自为战图片CNNResNet、VGG统治计算机视觉文本RNN/LSTM后来 BERT 出现语音传统 HMMGMM后来端到端模型跨模态图文检索、图像描述但能力有限都是小模型解决的问题各模态内部的基础能力建设第二阶段2018-2020Transformer 统一架构BERT、GPT 出现文本 Transformer 成熟。ViTVision Transformer发布证明图片也能用 Transformer意义所有模态都可以用 Transformer 处理架构统一了解决的问题用统一架构处理不同模态为多模态融合铺路第三阶段2021对比学习突破跨模态对齐CLIPOpenAI发布用对比学习做图文对齐效果惊艳。ALIGNGoogle更大规模图文对比学习。意义解决了“图文怎么对齐”的核心问题多模态进入大模型时代解决的问题跨模态对齐让模型知道“这个词对应这张图”第四阶段2022-2023视觉语言模型与语音大模型爆发BLIPSalesforce高效视觉语言预训练Stable Diffusion 开源图像生成爆发WhisperOpenAI语音识别大模型FlamingoDeepMind少样本多模态学习BLIP-2SalesforceQ-Former 桥接视觉与语言意义从“对齐”到“理解和生成”多模态能力全面提升解决的问题视觉理解、语音识别、图像生成的实用化第五阶段2023 至今通用多模态大模型与全模态统一GPT-4 发布纯文本LLaVA 开源开源视觉语言模型标杆GPT-4V 正式开放视觉能力多模态大模型进入公众视野Gemini 1.0 发布多模态原生SoraOpenAI发布视频生成里程碑全模态大模型图文音视频统一加速演进Qwen3-Omni业界首个原生端到端全模态模型、InternVL-U 等统一多模态模型发布意义从专用多模态到通用多模态从理解到生成从拼接式到原生多模态解决的问题通用多模态能力、视频生成、全模态统一十、不同阶段解决了什么问题阶段时间核心突破解决的问题单模态时代2018 前CNN/RNN 成熟各模态基础能力架构统一2018-2020Transformer ViT用统一架构处理多模态对齐突破2021CLIP 对比学习跨模态语义对齐能力爆发2022-2023BLIP/Flamingo/Whisper/Stable Diffusion视觉理解、语音识别、图像生成通用多模态2023 至今GPT-4V/LLaVA/Gemini/Sora/Qwen3-Omni通用多模态理解与生成、全模态统一十一、目前格局怎么样截至 2026 年 8 月闭源阵营公司代表模型特点OpenAIGPT-5 系列GPT-5.6 Sol 等视觉主力、DALL-E、Sora、Whisper综合能力领先视频生成强GoogleGemini 2.5 / Gemini 3 系列、Imagen、Veo多模态原生设计Gemini 3 可实时处理长视频、音频、图像混合输入AnthropicClaude 4 系列Opus 4.6 / Sonnet 4.6视觉理解强长文本图片拥有业界领先的 100 万级长上下文窗口字节跳动豆包多模态、即梦、Seedance中文多模态生成能力强阿里Qwen-VL、Qwen3-Omni、通义万相开源闭源中文强全模态领先百度文心一言多模态中文搜索多模态开源阵营方向代表模型特点视觉语言理解LLaVA 系列、Qwen3-VL、InternVL3.5、Mini-InternVL、CogVLMQwen3-VL 支持百万 token 上下文、视频理解超 2 小时InternVL3.5 旗舰在 MMMU 上 77.7 分多模态通用感知能力超越 GPT-5语音识别Whisper、SenseVoice、Paraformer、Qwen3-ASR、FireRedASR、FunASRSenseVoice 中文/粤语远超 Whisper 同尺寸推理快约 15 倍Apache-2.0 协议FireRedASR 在 AISHELL-1 上 CER 0.57%语音生成CosyVoice、ChatTTS、Qwen3-TTS、Fish-Speech、MaskGCT中文语音合成图像生成Stable Diffusion、FLUX.1、通义万相、Qwen-Image-Edit开源图像生成成熟视频生成Open-Sora、CogVideoX、Wan2.5、HunyuanVideo、Seedance快速追赶闭源全模态Qwen3-Omni / Qwen3.5-Omni、InternVL-UQwen3.5-Omni 在 215 项任务上 SOTA超越 Gemini-3.1 ProInternVL-U 统一多模态理解、推理、生成与编辑四大趋势趋势 1从双模态到全模态早期图文CLIP现在图文音视频统一Gemini、Qwen3-Omni、InternVL-U未来传感器、3D、动作等更多模态趋势 2从理解到生成2021-2022理解为主看图回答问题2023-2024图像生成成熟SD、DALL-E2024-2025视频生成爆发Sora、即梦、Seedance未来3D 生成、世界模型趋势 3从专用模型到统一大模型早期图片模型管图片语音模型管语音现在一个模型处理所有模态GPT-5、Gemini、Qwen3-Omni未来一个模型理解和生成所有模态趋势 4从拼接式到原生多模态以及端侧多模态拼接式2022-2023LLM 外挂编码器 投影层原生多模态2024-预训练阶段混合所有模态Qwen3-Omni、Gemini 为代表端侧多模态2025-端云协同——大模型做规划小模型做执行。Mini-InternVL 系列1B/2B/4B以约 5% 参数量实现 InternVL2-76B 约九成性能当前格局总结第一梯队OpenAI综合视频、Google多模态原生第二梯队Anthropic视觉理解长上下文、阿里开源全模态、字节生成中文开源追赶迅速Qwen3-VL、InternVL3.5 已在多项指标上接近或超越闭源水平中国厂商特点全模态Qwen3.5-Omni 超越 Gemini-3.1 Pro、开源多模态基座InternVL 全网下载量超 2300 万次、图像/视频生成即梦、可灵、Seedance十二、一句话总结多模态模型通过各自的编码器把图片切 Patch、语音分帧、视频抽帧统一转成向量序列送入 Transformer核心难点是跨模态对齐。主流架构已从“编码器LLM 基座”的拼接式演进到原生多模态。发展经历了单模态→架构统一→对比学习→能力爆发→通用多模态五个阶段目前 OpenAI 和 Google 领先开源快速追赶趋势是全模态、生成式、统一大模型、端侧协同。