00 SIXTEEN LEDGERS
不要先背模型名,先问视觉信息在哪一层丢了
多模态不是“给语言模型装一双眼睛”这么简单。像素可能在 resize 时丢失,视觉塔可能看见却没通过 connector,语言主干可能被常识先验带偏,工具闭环也可能因为权限或验证器失败。十六张账把这些问题逐层拆开。
PREREQUISITE / CHAPTER 02先理解 Token、位置、多头注意力和残差,才能看清 ViT 与语言主干共享了什么。
语义空间
图像怎样靠近语言?分类标签、图文对比、caption 与生成目标不是同一层。
连接器
视觉特征怎样进 LLM?prefix、resampler、cross-attention、Q-Former、MLP。
Token 预算
细节为什么如此昂贵?分辨率、patch、tile、shuffle、上下文与预填充成本。
OCR / 文档
模型是在看图还是读结构?小字、阅读顺序、公式、表格、版面与多语言。
时间
动作顺序怎样进入模型?采帧、时空注意力、时间池化、长视频检索。
融合时机
视觉何时遇见文字?early fusion、cross-attention、直接 Token 拼接与晚融合。
理解 / 生成
同一视觉表示能兼顾两端吗?语义鲁棒性与像素可逆细节可能冲突。
视觉指令
对齐后为何仍不会协作?对话、密集描述、OCR、推理与行动轨迹。
多模态 RL
奖励怎样回到像素证据?结果奖励、工具使用、视觉校准与跨模态迁移。
工具闭环
看不清时能否主动再看?crop、zoom、OCR、Python、截图、验证器。
幻觉
语言先验为何压过视觉?输入损失、接口损失与生成偏置。
安全
图片里的文字可信吗?视觉提示注入、隐私、权限与工具副作用。
评测
一个总分混进了什么?感知、OCR、知识、推理、视频、Agent 与输入预算。
训练系统
动态图像怎样组 batch?packing、straggler、并行、pipeline bubble 与吞吐。
稀疏路由
视觉 Token 会去哪类专家?负载、专家专化、路由波动与开放证据缺口。
产品谱系
DeepSeek 与 Kimi 各解哪道题?理解、生成、OCR 与原生训练不能压成单线升级。
多模态模型是一条受 Token 预算约束的信息管道:视觉编码器决定看见什么,连接器决定传过去什么,主干决定怎样融合,工具闭环决定能否主动获取新证据。
像素先变成可扩展表征
AlexNet · ResNet · ViT卷积残差让深视觉可训练;ViT 进一步把图像变成 patch 序列。
留下的债:类别监督封闭,固定分辨率会丢失长图和小字。自然语言成为视觉监督
CLIP · ALIGN · LiT · SigLIP图像获得开放词汇语义空间,预训练视觉塔可以被大量下游模型复用。
留下的债:匹配相似度不是开放式生成,细粒度 OCR 与关系仍弱。寻找 LLM 的视觉入口
Frozen · Flamingo · BLIP-2 · LLaVA前缀、跨注意力、query bottleneck 与简单 MLP 形成不同连接器范式。
留下的债:冻结带来效率,也把跨模态翻译压在狭窄 bridge 上。分辨率、文档与视频成为主矛盾
NaViT · dynamic tiling · OCR · temporal pooling模型开始保留长宽比、小字、页面结构与时间关系。
留下的债:视觉 Token、预填充、straggler 与上下文竞争迅速上升。理解与生成走向统一,但路线分叉
Chameleon · Transfusion · SOLO · Janus统一序列、统一主干、混合目标和解耦视觉路径都成为可选设计。
留下的债:“统一”一词开始同时指四件不同的事。开放产品线形成自己的答案
DeepSeek-VL/VL2 · Janus · OCR · Kimi-VL/K2.5/K3高分辨率、稀疏骨干、光学压缩、统一视频和原生联合训练进入规模化报告。
留下的债:总参数、激活参数、像素预算和作者报告值更容易被错误横比。视觉进入 RL 与 Agent 闭环
Vision-R1 · VTool-R1 · ToolsRL · OSWorld · K3模型能主动购买新观察、操作环境并以最终状态验证。
留下的债:模型、工具、harness、步数、权限和 verifier 必须一起审计。01 FIVE-LAYER PIPELINE
一张图进入模型后,至少穿过五道门
“模型答错了”只能描述终点,不能定位故障。更可用的办法是沿数据流逐层问: 输入还保留证据吗?视觉塔编码了吗?压缩后传过去了吗?主干引用了吗?最终答案或动作被验证了吗?
分辨率、长宽比、采帧、裁剪与音频 / 字幕。
失败:细节在进模型前消失CNN、ViT、SigLIP、MoonViT、DeepEncoder。
失败:视觉表征不适合任务tile、resampler、Q-Former、pixel shuffle、MLP。
失败:接口成为信息瓶颈语言先验、跨模态注意力、MoE、长上下文。
失败:看见却没有引用回答、生成图像、代码、工具调用与环境状态。
失败:输出没有独立验证LLM 收到
回答引用
视觉忠实
最终状态正确
把它想成一条证据管道。模型越大,只能改善其中一部分;如果发票小字在 resize 后只剩几个模糊像素,再强的语言推理也无法恢复原始数字。
02 VISUAL TOKEN MATH
分辨率的成本是平方,不是一条免费滑杆
Vision Transformer 把图像切成 patch。若图像为 H × W,patch 边长为 P, 最粗略的视觉位置数是高、宽两个方向 patch 数的乘积。
Nvisual ≈ Npatch ÷ s²
s × s 表示空间合并因子。视频还要乘帧数,再除时间池化因子。真实模型还会加入 thumbnail、tile、分隔符、padding 与 packing。2×2 合并后约 64
2×2 合并后约 1,369
2×2 合并后仍有 16,384
小字、细线、对象与空间关系
文字、历史、视频与工具观察共用
ViT、prefill、显存、通信与尾延迟
“最高支持 3584²”不意味着每张图都该用满。最大输入是容量上限;最佳输入取决于信息密度、上下文和系统预算。
03 VISUAL BACKBONES
语言模型能看图之前,视觉先学会了可迁移表示
AlexNet 证明 GPU 与大卷积网络可以在 ImageNet 规模学习视觉特征;ResNet 用残差路径让更深网络更易优化; ViT 则把图像切成 patch 序列,直接复用 Transformer。真正与 LLM 接轨的关键,不是“图像也有注意力”,而是两种模态开始共享序列接口、位置机制和缩放工具。
AlexNet
局部卷积与层级特征;类别空间封闭。
ResNet
残差高速公路让更深视觉骨干稳定训练。
Vision Transformer
图像 patch 变成标准 Transformer 序列。
ResNet ·Vision Transformer。 这是视觉表示前史,不应倒写成“早期 LLM 多模态”。
04 LANGUAGE SUPERVISION
CLIP 的突破:文字不再只是类别名,而是视觉的开放词汇监督
CLIP 分别编码一批图像与文本,得到一个 N × N 相似度矩阵。正确配对在对角线; 对比目标拉近正确图文、推远错误组合。分类时不必训练新分类头,只要把类别写成自然语言提示。
“a photo of a tabby cat”text encodert₁ … tₙ
开放语义空间
- 自然语言类名
- 零样本迁移
- 可复用视觉塔
生成与细节
- 不会开放式长回答
- 全局对齐不保证 OCR
- 计数与关系仍可能弱
因此,CLIP 是后续 VLM 的视觉语义地基,不是完整视觉助手。把“图文可比较”变成“根据图像连续生成答案”,仍需要语言主干、连接器、指令数据与生成目标。 参见 CLIP 原论文。
05 ALIGN · LIT · SIGLIP
同样叫图文对齐,谁更新、怎样归一化、数据多脏都不同
扩大噪声图文对
用超大规模 web 图文对证明“规模可以部分抵消手工清洗不足”,但不会消除偏见、重复和错误配对。
锁住图像塔
保留已有强视觉空间,只训练文本侧去匹配;“冻结谁”本身就是训练配方。
独立 pair sigmoid
不再把整个 batch 放进同一个 softmax;每对图文独立做二元 sigmoid 分类。
softmax(similarity matrix)正确 pair 与 batch 内所有候选竞争。
Σ log σ(yᵢⱼ · scoreᵢⱼ)每一对图文独立判断匹配 / 不匹配。
SigLIP-SO400M 后来成为 DeepSeek-VL2、Kimi-VL、K2.5 等模型的重要视觉初始化。 但一种更好的对齐损失不会自动解决动态分辨率、connector、语言生成或工具使用。 一手来源:ALIGN、LiT、SigLIP。
06 CONNECTOR ERA I
Frozen 与 Flamingo:一个学视觉前缀,一个让语言层按需读视觉
早期路线的核心约束是:已有语言模型很强、训练一次很贵,能否少动它?答案产生了两种不同接口。
视觉编码器学习产生连续 embedding,作为冻结 LLM 的前缀。语言模型保留能力,但视觉前缀承担重翻译任务。
Perceiver Resampler 把可变视觉特征压成固定潜变量,再用 gated cross-attention 插入冻结语言层之间。
视觉信息是作为普通序列位置进入自注意力,还是保留在独立 memory 里让语言层跨注意力读取?两者的上下文成本和系统实现完全不同。
07 CONNECTOR ERA II
BLIP-2 与 LLaVA:高效瓶颈和简单基线,各自买到了什么?
VISION→
LLM
固定 query 是效率,也是上限
Q-Former 用有限 query 从视觉特征取信息。训练参数少,但细粒度场景必须挤过固定瓶颈。
VISION→
TOKENS
架构简单,把重心交给数据
线性 / 两层 MLP projector 配合生成式视觉指令数据,成为开放 VLM 最易复现的路线之一。
图里有什么
局部、关系、文字
按用户意图回答
推理、工具与验证
connector 参数少,不代表它不重要。它是视觉塔与 LLM 之间的带宽和坐标变换;信息能否被语言注意力使用,正由这里决定。
08 RESOLUTION STRATEGIES
固定缩放、动态切图、NaViT packing:三种办法,三种不同债务
统一缩成正方形
batch 和吞吐最规则;长图被压扁、crop 丢边缘、小字最先消失。
系统简单 / 视觉损失高全局缩略图 + 局部 tile
复用固定视觉塔并保留细节;tile 重复、顺序与 Token 成本成为新问题。
局部清晰 / 上下文昂贵把不同形状 patch 打包
保留长宽比,在固定 Token 预算内装多张图;需要 mask、位置与变长系统支持。
形状原生 / 系统复杂NaViT 的关键不是“无限分辨率”,而是取消 batch 中所有图像必须同尺寸的假设。 DeepSeek-VL2 代表动态切图路线;MoonViT 代表 native-resolution packing 路线。二者都仍受最大 Token、显存与上下文约束。
09 OCR · DOCUMENTS
一页文档不是自然照片:它同时是像素、文字和二维程序
文档理解要求模型同时回答三件事:字符是什么?阅读顺序是什么?字符在表格、公式、标题和注释中扮演什么结构角色? OCR 错一位小数,后面的数学推理可以完全正确却得到错误答案。
多语言、手写、公式、小字号与非语义字符串。
多栏、脚注、图例与复杂页面并非机械栅格扫描。
表格 cell、键值关系、公式树与跨页引用。
+ 84
= 1,284
读到事实后,还要计算、比较、验证和引用证据。
OCRBench 把文字识别、场景文字 VQA、文档 VQA、关键信息抽取与手写公式放在同一评测框架。 它提醒我们:只测自然图 VQA,会遗漏真实办公场景最常见的瓶颈。
10 VIDEO
视频不是“很多张独立图片”:时间本身也是证据
“杯子先掉下还是人先伸手”“红灯出现了多久”“哪个镜头解释了结局”,都不能只靠静态帧集合回答。 最直接的逐帧编码又会让视觉 Token 随帧数线性增长。
再做 4× 时间池化可把位置约降四倍,但不会免费保留所有短暂事件。
Video-MME 的评测包含短中长视频,并区分是否提供字幕和音频。 报告视频结果时必须同时记录采帧策略、最大帧数、字幕 / 音频与上下文预算。
11 WHAT DOES “NATIVE” MEAN?
“原生多模态”不是行业统一开关,至少要拆成五个维度
厂商可以用“native”描述输入、数据、架构或训练。若不拆词,我们会把“早期加入图像”“图文共同 NTP”“没有事后 alignment” 和“能视觉工具闭环”误当成同一个命题。
视觉数据是否从预训练早期进入,而非只在末期补课?
视觉塔是否与主干共享生成目标或同一训练制度?
视觉塔与语言主干是否共同更新,而非只学一个事后 bridge?
图、文、视频、代码和渲染能否在同一序列交错?
动作后能否重新看环境,继续推理并验证?
K3 明确保留约 0.4B 的 MoonViT-V2 与轻量 MLP projector。它的“原生”重点是从头共同 next-token prediction、 无 post-hoc modality alignment,以及视觉在长程工具轨迹中的持续回流。
12 FOUR KINDS OF UNIFICATION
统一序列、统一主干、统一目标、统一行为,是四件事
图像 Token 与文字 Token 可以交错。
不同模态共享大部分计算层。
共同 NTP,或在同一主干混合 NTP 与 diffusion / flow。
理解、生成、工具动作和重新观察进入一条轨迹。
全部离散化
图文交错离散 Token,用 early-fusion 自回归统一建模。图像 tokenizer 质量和长视觉序列成为代价。
主干统一,损失分流
TEXT→ONE
TRANSFORMER←DIFFUSION
IMAGE
文字做 next-token prediction,连续图像做 diffusion;统一主干不要求统一输出表示。
主干统一,编码解耦
BACKBONE↗GENERATE
理解与生成使用不同视觉编码路径,避免语义鲁棒表征与像素可逆表征互相拉扯。
一手来源:Chameleon ·Transfusion ·SOLO ·Janus。
13 DEEPSEEK SPOTLIGHT
DeepSeek 的多模态工作不是一条直线,而是三条不同问题分支
把 DeepSeek-VL、Janus、OCR 画成单向“代际升级”会误导:VL 系列优化高分辨率理解, Janus 探索理解与生成怎样共用主干,OCR 系列研究二维视觉能否成为长上下文压缩介质。
固定混合编码器 → 动态 tile;高分辨率、OCR、MoE 与语言能力保持。
输出中心:文字理解解耦视觉编码路径,共享自回归主干;离散生成与 rectified flow 分叉。
输出中心:文字 + 图像文字渲染成二维页面,用视觉 Token 压缩;再让语义重排改善阅读顺序。
研究中心:压缩与解码同一组织的论文可以共享模型、数据和工程经验,但只要优化目标不同,就不能拿“新年份”替代架构比较。
14 DEEPSEEK-VL → VL2
从双视觉尺度到动态 tile:高分辨率怎样进入稀疏语言骨干
DeepSeek-VL 面向网页截图、PDF、OCR、图表与真实用例, 使用混合视觉编码器处理 1024² 输入。它尤其强调:视觉预训练一开始就保留语言数据,主动管理视觉—语言竞争,避免语言能力被覆盖。
两个尺度看同一张图
semantic1024
detail
- 混合视觉编码器
- 1024² 真实场景输入
- 预训练早期混入语言数据
全局缩略图 + 最多九个局部 tile
384
- 候选网格满足 m·n ≤ 9
- 每 tile 729 embedding
- 2×2 pixel shuffle 后 196 Token
全局缩略图 + 局部视野
固定视觉编码尺寸
729 → 196 / tile
映射到语言空间
稀疏语言骨干
VL2 论文列出的 1.0B、2.8B、4.5B 是不同版本的激活参数量,不能与总参数混用。动态 tile 也不是任意无限切图:论文候选约束为 m·n ≤ 9。
15 JANUS FAMILY
为什么“看懂一张图”和“生成一张图”可能不该共用同一视觉入口
- 同一对象跨风格仍接近
- 忽略不重要像素噪声
- 方便与语言概念对齐
- 保留纹理与颜色
- 保留精确空间布局
- 能解码回高质量像素
更关心概念与关系
更关心可恢复视觉细节
解耦理解与生成视觉编码路径,保留统一自回归主干。
语言自回归 + 图像 rectified flow,并对两种表示做对齐。
延续基本架构,改进训练策略、数据与规模。
16 DEEPSEEK-OCR · OCR2
最反直觉的一条 DeepSeek 路线:把文本先画成图,再用视觉 Token 压回去
这不是为了把已有数字文字变得更清晰,而是在问:二维页面能否像人类速览一页纸那样, 用远少于原始文本序列的位置保留足够信息?
压缩越强,解码错误通常越多。
论文报告的解码精度区域
论文报告的更强压缩区域
OmniDocBench 特定设置
论文生产管线报告值
压缩率依赖文本 tokenizer、渲染、字体、语言、页面版式、视觉 Token 定义与解码目标。上述数字不是本站复测,也不代表任意文档。
OCR2:阅读顺序本身也可以学习
DeepSeek-OCR2 用 DeepEncoder V2 根据图像语义动态重排视觉 Token, 把问题描述为两个串联的一维因果结构:视觉侧决定读取序列,语言侧沿该序列解码。 这改善序列组织,但不等于二维结构已被完全解决。
17 KIMI SPOTLIGHT
Kimi 三代 MoonViT 的主线,不是“像素越来越大”,而是训练制度越来越统一
MoonViT
- INIT
- SigLIP-SO400M
- OBJECTIVE
- SigLIP + caption
- ALIGN
- 0.1T 显式对齐
- VIDEO
- 长上下文输入
MoonViT-3D
- INIT
- SigLIP continual
- OBJECTIVE
- caption NTP
- ALIGN
- ViT / projector bridge
- VIDEO
- 共享参数 + 时间池化
MoonViT-V2
- INIT
- 从头训练
- OBJECTIVE
- 共同 NTP
- ALIGN
- 无 post-hoc stage
- VIDEO
- 共享参数 + 视觉闭环
对齐一个强视觉塔→用生成目标统一图像 / 视频→从头共同优化视觉塔与超大 MoE 主干
18 KIMI-VL
MoonViT:把 NaViT 原生分辨率、SigLIP 语义和稀疏 MoE 接到一起
NaViT packing
SigLIP init · abs pos + 2D RoPE
空间位置约降 4×
视觉 → 语言维度
约 2.8B 激活 MoE
独立视觉阶段的目标
从 5.2T 纯文本主干到额外 4.4T 多模态训练
Moonlight 中间 checkpoint
MoonViT / projector
图文联合预训练
高质量分布
8K → 128K
这些数字来自 Kimi-VL 官方论文。 这一代已经做联合预训练,却仍有独立 ViT 与 0.1T alignment,因此不属于 K3 定义的“无事后对齐”。
19 KIMI K2.5
MoonViT-3D:图像和视频共享;zero-vision 只发生在 SFT
每帧内部对象与布局
动作顺序与变化
四帧 patch 轻量聚合
SigLIP contrastive + caption CE视觉语义对齐 + 生成目标
caption CE only图像 / 视频条件 next-token generation
“zero-vision SFT”最容易被误读
图像 / 视频早已进入基础能力
用 IPython 程序操作激活视觉工具行为
grounding、counting、文档、图表与 STEM
“zero-vision”只修饰 SFT。K2.5 预训练约 15T 图文 Token,之后的 outcome-based RL 也使用视觉任务。作者还报告部分文本基准在视觉 RL 后提升,但这不是普遍规律。
20 KIMI K3 · NATIVE MULTIMODALITY
K3 的关键变化:不再把视觉塔事后嫁接到已经成型的语言主干
K3 报告把语言与视觉从训练开始共同优化,以 next-token prediction 作为共同训练制度, 并取消 post-hoc modality-alignment stage。视觉、代码、渲染物和新观察还能在百万 Token 级 Agent 轨迹里反复交错。
语言主干先成型,视觉通过独立阶段找入口。
视觉塔、projector 与 2.8T MoE 主干在共同目标下从训练早期协同。
Vision Transformer
MoonViT-V2
无 bias
空间 / 时间分解注意力
2×2 pixel shuffle
报告支持上限
一手来源:Kimi K3 Technical Report。
21 FROM-SCRATCH VISION
为什么放弃一个强 SigLIP 初始化?K3 的答案来自联合优化稳定性
K3 报告称,在与 2.8T MoE 主干联合训练的消融中,SigLIP 初始化的 MoonViT-3D 持续出现更高梯度范数和更多尖峰; 从头训练的 MoonViT-V2 梯度更低、更平稳,并在其视觉评测中达到相当能力。
SigLIP 初始化视觉塔梯度更高、尖峰更多。
从头 NTP 可达到相当视觉评测。
架构、规模、数据和优化器改变后结论可能变化。
图中只复现论文主张的趋势,不重绘原始数值。正确表述是“在 K3 的训练消融中”,而不是“SigLIP 初始化普遍不稳定”。
22 PROGRAMMATIC MULTIMODAL DATA
当代码能渲染世界,多模态数据就不再只是“图片配一句话”
K3 扩大程序化多模态数据,把代码与其可渲染产物绑在一起:SVG、3D、Web、游戏、CAD、动效和视频编辑。 这些样本天然包含可执行规格、视觉结果与可修改源程序。
自然语言需求与约束
<svg> <path ... /> </svg>可执行中间表示
HTML / SVG / JS / CAD
模型可以重新观察
形成视觉闭环
传统 caption 只告诉模型“图里有什么”;程序化样本还能告诉它“怎样产生、怎样修改、怎样验证这个视觉结果”。这把理解、生成、代码和 Agent 行为接到同一数据闭环。
23 INTERACTIVE LAB
现在亲手调分辨率、训练制度、光学压缩与视觉工具闭环
前三个实验分别抓住容量、训练和压缩;第四个实验专门证明“文字思考更长”和“主动获得新视觉证据”不是同一种测试时计算。
INTERACTIVE / MULTIMODAL LAB
像素进来以后,亲手拨动四个真正的瓶颈
Token 数和训练制度是确定性教学模型;DeepSeek-OCR 曲线中的插值会明确标注, 不冒充论文实测。实验的目标是建立量纲与边界,而不是模拟某个真实模型分数。
分辨率翻倍,为什么视觉 Token 接近四倍?
这里按正方形图像和规则 patch 计算。真实模型还可能加入缩略图、tile、分隔符、padding 与动态 packing。
进入视觉预处理的像素
ceil(H/P) × ceil(W/P) × frames
空间与时间压缩后的教学近似
尚未计算文字、工具结果与输出
单图细节与长文字仍有较大共存空间。
Token 变少不是免费信息压缩:小字、细线和短暂事件更容易丢失。
“接上视觉”有七种完全不同的含义
点击模型,观察谁冻结、谁训练、是否有单独 alignment,以及“原生”究竟命中了哪几个维度。
训练信号怎样穿过视觉接口
是否先把视觉特征对到语言空间
简单 projector 加视觉指令数据成为开放 VLM 的强基线。
本站用五个可核验维度拆词,不把厂商命名当成事实定义。
- 01数据早期进入
- 02生成目标统一
- 03联合优化
- 04交错输入输出
- 05视觉 Agent 闭环
把 20,000 个文字 Token 渲染成页面,真的更省吗?
压缩比可以精确计算;解码准确率只显示论文锚点或明确标记的教学插值。
tokenizer 后的原始上下文
→
二维页面作为压缩介质
→
pages × tokens per page
视觉序列更短,但尚未计算渲染与解码误差。
论文报告:低于 10× 区域约 97%。
不是本站复测,也不外推到所有语言、字体与版式。
“总额是多少?”:长思考与新观察不是一回事
同一张小字发票,比较直接回答、文字 CoT 与裁剪—OCR—计算—验证闭环。
STUDIO SUPPLY
- SUBTOTAL
- 1,200.00
- TAX
- 84.00
- TOTAL
- 1,284.00
读取整张发票并定位右下角金额区
获得一个候选区域,而不是直接猜答案。
教学案例只说明信息流差异,不代表任何真实模型的准确率。
24 MULTIMODAL HALLUCINATION
模型为什么会描述出图里不存在的东西?因为答案来自证据与先验的竞争
- resize 丢小目标
- connector 压缩
- 遮挡 / 模糊
- 厨房常有微波炉
- 训练描述常共现
- 流畅答案得到偏好
缩放、裁剪、采帧与图像质量。
query、projector、Token 压缩与注意力。
语言先验、共现、奖励与解码。
POPE 用对象存在性轮询诊断幻觉;HallusionBench 进一步用控制组问题拆开语言幻觉、视觉错觉、回答倾向和逻辑一致性。 单个 yes/no 分数不能覆盖属性、关系、OCR 与长回答忠实度。
动态分辨率、裁剪、负例、密集描述。
region、bbox、OCR span、证据截图。
zoom、OCR、Python、检索与工具。
计算、规则、环境 final state 与拒答。
25 EVALUATION MAP
一个多模态总分,会把感知、OCR、知识和推理揉成无法诊断的平均数
6 大学科、30 学科、183 子领域、30 种图像类型。
28 个已有数据集 + 3 个新数据集。
识别、VQA、KIE 与手写公式。
254 小时、2700 问答,短中长视频。
checkpoint + preprocessing + max pixels / frames + prompt + context + tools + evaluator + score同名模型若 tile、帧数、字幕或工具预算不同,就不是同一个评测条件。
26 VISUAL AGENTS
从回答一张图到改变桌面:视觉输入一旦进入行动闭环,安全边界也跟着扩大
一次图像观察 → 文字答案
验证:参考答案crop / OCR / Python → 新观察
验证:计算或证据连续截图 → 鼠标 / 键盘 / 代码
验证:环境 final stateVisualWebArena 把视觉网页任务放进可执行网站;OSWorld 使用真实桌面应用与执行式验证。 此时“看懂截图”不等于“坐标落对”,更不等于“跨应用最终状态正确”。
决定允许的目标、权限与审批。
可能包含间接提示注入,不能自动升级为指令。
最小权限、可回滚、可审计与独立验证。
27 SYSTEMS · MOE
动态图像让训练 batch 变得不规则;稀疏 MoE 又把不规则传给路由与通信
长图、长视频和多图样本形成 straggler。
按视觉 Token 分桶、NaViT / sequence packing。
K3 报告把部分 ViT 工作塞进 pipeline bubble。
路由专化、热点与稳定性仍缺公开细证据。
Kimi-VL 与 K3 的吞吐或 bubble 隐藏结论都依赖硬件、精度、batch、分辨率分布、并行拓扑和比较基线,只能写成各自配置下的作者报告。
视觉 Token 进入 MoE 后是否形成稳定“视觉专家”,当前公开证据不足。本章把它列为开放问题,不从少量路由热图猜测语义专化。
28 AUDIT CHECKLIST
以后再看到一款“原生多模态旗舰”,用这十问把宣传词还原成技术事实
输入
最大像素、tile、帧数、字幕 / 音频和 context 分别是多少?
视觉塔
从什么 checkpoint 初始化?固定还是更新?图像与视频是否共享?
压缩
patch、pixel shuffle、resampler、时间池化分别丢掉什么?
连接器
prefix、cross-attention、Q-Former、MLP,还是单主干?
训练
哪些阶段使用对比、caption、NTP、SFT、RL?谁被更新?
“原生”
数据、目标、优化、输入输出、Agent 五维究竟满足哪些?
输出
只生成文字,还是也生成图像、代码、工具动作和新观察?
评测
感知、OCR、知识、推理、视频与 Agent 是否分别记录?
系统
视觉 Token 怎样打包、并行和限制长尾?吞吐基线是什么?
安全
图像文字被当作数据还是指令?工具副作用怎样授权和验证?
当前没有定论的问题
- 从头训练视觉塔的稳定性结论,能否跨规模、数据和架构复现?
- 视觉 Token 在稀疏 MoE 中是否产生稳定、可迁移的专家专化?
- 光学上下文压缩何时优于文本 tokenizer、KV 压缩或外部 memory?
- 视觉 RL 对文本任务的正迁移,来自算法、数据难度还是 reward 结构?
- vision-in-the-loop 的收益中,模型、工具、harness 与 verifier 各占多少?
从像素到视觉 Token,从 CLIP 语义到 connector,从高分辨率、文档和视频到统一理解生成, 再从 DeepSeek 三分支与 Kimi 三代 MoonViT 走到视觉 RL、Agent、安全与系统。 你现在可以不依赖营销命名,逐层解释一款多模态模型到底改变了什么。
↳ PRIMARY PAPER CHAIN
本章的一手论文链
正文只保留改变表示、接口、训练目标、系统策略或评测方法的关键节点。所有链接直达论文或正式会议页面; 报告数字不做跨模型无条件横比。
GPU 与大规模卷积视觉表示的转折点。
ResNet残差连接让深视觉骨干更易优化。
Vision Transformer把图像切成 patch,进入标准 Transformer 序列。
ALIGN把噪声 web 图文对扩到超大规模。
CLIP自然语言监督的开放视觉语义空间。
Frozen视觉前缀接入冻结语言模型。
LiT锁定图像塔,只调文本侧对齐。
BLIPcaptioner 与 filter 重建图文数据质量。
FlamingoPerceiver Resampler 与 gated cross-attention。
BLIP-2Q-Former 连接冻结视觉塔与冻结 LLM。
SigLIP用独立 sigmoid pair loss 取代 batch softmax。
LLaVA简单 projector 与生成式视觉指令调优。
MiniGPT-4少量高质量对话对齐冻结视觉与语言模块。
InstructBLIPinstruction-aware Q-Former 与任务泛化。
PaLI-X多语言视觉—语言模型的组件、任务混合与规模扩展。
OCRBench识别、DocVQA、KIE 与公式的综合 OCR 评测。
POPE用轮询式问题诊断对象幻觉。
Kosmos-2用 location token 把文字指称落到视觉区域。
NaViT在 Token 预算内打包任意长宽比图像。
MMBench双语多选与 CircularEval 综合评测。
Qwen-VLOCR、grounding 与开放视觉对话路线。
LLaVA-1.5两层 MLP、数据混合与工程基线。
MathVista视觉上下文中的数学推理。
HallusionBench语言幻觉、视觉错觉与一致性诊断。
Video-LLaVA图像与视频的共同视觉—语言空间。
MMMU大学级多学科视觉理解与推理。
LLaMA-VID内容 / 上下文 Token 压缩长视频。
RLHF-V用细粒度人工纠错与 dense DPO 对齐视觉忠实度。
VisualWebArena真实网站中的视觉 grounding Agent。
DeepSeek-VL真实场景、高分辨率与语言能力保持。
MM1系统研究架构、数据和训练配方的相对作用。
InternVL 1.56B 视觉塔、最多 40 个动态 tile 与双语高质量数据。
OSWorld真实桌面截图、动作与执行式验证。
Chameleon图文交错离散 Token 的 early-fusion 模型。
Video-MME短中长视频、字幕与音频条件评测。
Visual Sketchpad用画线、框选和视觉工具产生可回看的视觉思维步骤。
JEST按 batch 联合可学习性筛选多模态训练样本。
SOLO单一 Transformer 视觉—语言训练配方。
LLaVA-OneVision单图、多图、视频统一迁移路线。
Transfusion同一主干混合文字 NTP 与图像 diffusion。
Qwen2-VL动态视觉 Token、M-RoPE 与统一图像 / 视频处理。
Janus解耦理解 / 生成视觉编码路径。
JanusFlow自回归语言与 rectified flow 图像生成。
InternVL 2.5从模型、数据与测试时三个轴扩展开放多模态模型。
DeepSeek-VL2动态 tile、pixel shuffle、MoE 与 MLA。
Janus-Pro优化训练阶段、数据和规模。
Qwen2.5-VL从头训练动态分辨率 ViT、绝对时间编码与视觉 Agent。
Vision-R1大规模 RL 激活多模态推理。
Kimi-VLMoonViT 原生分辨率与稀疏 MoE。
VTool-R1强化学习训练自主视觉工具调用。
DeepSeek-OCR把二维视觉表征用作长上下文压缩介质。
DeepSeek-OCR2依据图像语义动态重排视觉 Token。
Kimi K2.5MoonViT-3D、zero-vision SFT 与视觉 RL。
ToolsRL面向视觉工具使用的强化学习。
Kimi K3MoonViT-V2 从头共同 NTP 与视觉闭环 Agent。