MULTIMODAL / 13 PIXELS · TOKENS · ACTION

图像是外接插件,
还是第一类输入?

从 ViT 把像素切成 Token、CLIP 建立开放语义空间,到 Frozen / Flamingo / BLIP-2 / LLaVA 寻找视觉入口;再沿 DeepSeek 的理解、生成、光学压缩三分支,与 Kimi 三代 MoonViT, 走到 K3 从训练起共同优化、并能反复“看—做—再看”的原生多模态。

LEVEL
L0 直觉 → L3 系统
LEDGERS
16 张问题账
NODES
55 个一手节点
LAB
4 个交互实验
TIME
约 220–300 分钟
VERIFIED
2026-07-29

00 SIXTEEN LEDGERS

不要先背模型名,先问视觉信息在哪一层丢了

多模态不是“给语言模型装一双眼睛”这么简单。像素可能在 resize 时丢失,视觉塔可能看见却没通过 connector,语言主干可能被常识先验带偏,工具闭环也可能因为权限或验证器失败。十六张账把这些问题逐层拆开。

PREREQUISITE / CHAPTER 02
注意力与 Transformer

先理解 Token、位置、多头注意力和残差,才能看清 ViT 与语言主干共享了什么。

回看 Transformer →
Q1 / SPACE

语义空间

图像怎样靠近语言?

分类标签、图文对比、caption 与生成目标不是同一层。

Q2 / BRIDGE

连接器

视觉特征怎样进 LLM?

prefix、resampler、cross-attention、Q-Former、MLP。

Q3 / BUDGET

Token 预算

细节为什么如此昂贵?

分辨率、patch、tile、shuffle、上下文与预填充成本。

Q4 / DOC

OCR / 文档

模型是在看图还是读结构?

小字、阅读顺序、公式、表格、版面与多语言。

Q5 / VIDEO

时间

动作顺序怎样进入模型?

采帧、时空注意力、时间池化、长视频检索。

Q6 / FUSION

融合时机

视觉何时遇见文字?

early fusion、cross-attention、直接 Token 拼接与晚融合。

Q7 / OUTPUT

理解 / 生成

同一视觉表示能兼顾两端吗?

语义鲁棒性与像素可逆细节可能冲突。

Q8 / SFT

视觉指令

对齐后为何仍不会协作?

对话、密集描述、OCR、推理与行动轨迹。

Q9 / RL

多模态 RL

奖励怎样回到像素证据?

结果奖励、工具使用、视觉校准与跨模态迁移。

Q10 / AGENT

工具闭环

看不清时能否主动再看?

crop、zoom、OCR、Python、截图、验证器。

Q11 / HALLU

幻觉

语言先验为何压过视觉?

输入损失、接口损失与生成偏置。

Q12 / SAFE

安全

图片里的文字可信吗?

视觉提示注入、隐私、权限与工具副作用。

Q13 / EVAL

评测

一个总分混进了什么?

感知、OCR、知识、推理、视频、Agent 与输入预算。

Q14 / SYSTEM

训练系统

动态图像怎样组 batch?

packing、straggler、并行、pipeline bubble 与吞吐。

Q15 / MOE

稀疏路由

视觉 Token 会去哪类专家?

负载、专家专化、路由波动与开放证据缺口。

Q16 / LINEAGE

产品谱系

DeepSeek 与 Kimi 各解哪道题?

理解、生成、OCR 与原生训练不能压成单线升级。

ONE-SENTENCE MODEL

多模态模型是一条受 Token 预算约束的信息管道:视觉编码器决定看见什么,连接器决定传过去什么,主干决定怎样融合,工具闭环决定能否主动获取新证据。

01

像素先变成可扩展表征

AlexNet · ResNet · ViT

卷积残差让深视觉可训练;ViT 进一步把图像变成 patch 序列。

留下的债:类别监督封闭,固定分辨率会丢失长图和小字。
02

自然语言成为视觉监督

CLIP · ALIGN · LiT · SigLIP

图像获得开放词汇语义空间,预训练视觉塔可以被大量下游模型复用。

留下的债:匹配相似度不是开放式生成,细粒度 OCR 与关系仍弱。
03

寻找 LLM 的视觉入口

Frozen · Flamingo · BLIP-2 · LLaVA

前缀、跨注意力、query bottleneck 与简单 MLP 形成不同连接器范式。

留下的债:冻结带来效率,也把跨模态翻译压在狭窄 bridge 上。
04

分辨率、文档与视频成为主矛盾

NaViT · dynamic tiling · OCR · temporal pooling

模型开始保留长宽比、小字、页面结构与时间关系。

留下的债:视觉 Token、预填充、straggler 与上下文竞争迅速上升。
05

理解与生成走向统一,但路线分叉

Chameleon · Transfusion · SOLO · Janus

统一序列、统一主干、混合目标和解耦视觉路径都成为可选设计。

留下的债:“统一”一词开始同时指四件不同的事。
06

开放产品线形成自己的答案

DeepSeek-VL/VL2 · Janus · OCR · Kimi-VL/K2.5/K3

高分辨率、稀疏骨干、光学压缩、统一视频和原生联合训练进入规模化报告。

留下的债:总参数、激活参数、像素预算和作者报告值更容易被错误横比。
07

视觉进入 RL 与 Agent 闭环

Vision-R1 · VTool-R1 · ToolsRL · OSWorld · K3

模型能主动购买新观察、操作环境并以最终状态验证。

留下的债:模型、工具、harness、步数、权限和 verifier 必须一起审计。

01 FIVE-LAYER PIPELINE

一张图进入模型后,至少穿过五道门

“模型答错了”只能描述终点,不能定位故障。更可用的办法是沿数据流逐层问: 输入还保留证据吗?视觉塔编码了吗?压缩后传过去了吗?主干引用了吗?最终答案或动作被验证了吗?

01 / INPUT
Pixels / Frames / Pages

分辨率、长宽比、采帧、裁剪与音频 / 字幕。

失败:细节在进模型前消失
02 / ENCODER
Vision Encoder

CNN、ViT、SigLIP、MoonViT、DeepEncoder。

失败:视觉表征不适合任务
03 / BRIDGE
Compress / Project

tile、resampler、Q-Former、pixel shuffle、MLP。

失败:接口成为信息瓶颈
04 / BACKBONE
Fuse / Reason

语言先验、跨模态注意力、MoE、长上下文。

失败:看见却没有引用
05 / OUTPUT
T
Text / Image / Action

回答、生成图像、代码、工具调用与环境状态。

失败:输出没有独立验证
视觉塔看见

LLM 收到

LLM 收到

回答引用

回答流畅

视觉忠实

动作合法

最终状态正确

PLAIN LANGUAGE

把它想成一条证据管道。模型越大,只能改善其中一部分;如果发票小字在 resize 后只剩几个模糊像素,再强的语言推理也无法恢复原始数字。

02 VISUAL TOKEN MATH

分辨率的成本是平方,不是一条免费滑杆

Vision Transformer 把图像切成 patch。若图像为 H × W,patch 边长为 P, 最粗略的视觉位置数是高、宽两个方向 patch 数的乘积。

Npatch = ceil(H / P) × ceil(W / P)
Nvisual ≈ Npatch ÷ s²s × s 表示空间合并因子。视频还要乘帧数,再除时间池化因子。真实模型还会加入 thumbnail、tile、分隔符、padding 与 packing。
224² / P14
256 patches

2×2 合并后约 64

1024² / P14
约 5,476 patches

2×2 合并后约 1,369

3584² / P14
65,536 patches

2×2 合并后仍有 16,384

DETAIL细节保真

小字、细线、对象与空间关系

CONTEXT序列预算

文字、历史、视频与工具观察共用

COMPUTE训练 / 推理成本

ViT、prefill、显存、通信与尾延迟

DON'T OVERREAD

“最高支持 3584²”不意味着每张图都该用满。最大输入是容量上限;最佳输入取决于信息密度、上下文和系统预算。

03 VISUAL BACKBONES

语言模型能看图之前,视觉先学会了可迁移表示

AlexNet 证明 GPU 与大卷积网络可以在 ImageNet 规模学习视觉特征;ResNet 用残差路径让更深网络更易优化; ViT 则把图像切成 patch 序列,直接复用 Transformer。真正与 LLM 接轨的关键,不是“图像也有注意力”,而是两种模态开始共享序列接口、位置机制和缩放工具。

CNN

AlexNet

局部卷积与层级特征;类别空间封闭。

RESIDUAL

ResNet

残差高速公路让更深视觉骨干稳定训练。

PATCH SEQUENCE

Vision Transformer

图像 patch 变成标准 Transformer 序列。

PRIMARY SOURCES

ResNet ·Vision Transformer。 这是视觉表示前史,不应倒写成“早期 LLM 多模态”。

04 LANGUAGE SUPERVISION

CLIP 的突破:文字不再只是类别名,而是视觉的开放词汇监督

CLIP 分别编码一批图像与文本,得到一个 N × N 相似度矩阵。正确配对在对角线; 对比目标拉近正确图文、推远错误组合。分类时不必训练新分类头,只要把类别写成自然语言提示。

IMAGE
vision encoderv₁ … vₙ
TEXT
“a photo of a tabby cat”
text encodert₁ … tₙ
correct pairs
CLIP SOLVED

开放语义空间

  • 自然语言类名
  • 零样本迁移
  • 可复用视觉塔
CLIP LEFT OPEN

生成与细节

  • 不会开放式长回答
  • 全局对齐不保证 OCR
  • 计数与关系仍可能弱

因此,CLIP 是后续 VLM 的视觉语义地基,不是完整视觉助手。把“图文可比较”变成“根据图像连续生成答案”,仍需要语言主干、连接器、指令数据与生成目标。 参见 CLIP 原论文

05 ALIGN · LIT · SIGLIP

同样叫图文对齐,谁更新、怎样归一化、数据多脏都不同

ALIGN / 2021

扩大噪声图文对

用超大规模 web 图文对证明“规模可以部分抵消手工清洗不足”,但不会消除偏见、重复和错误配对。

LiT / 2021

锁住图像塔

VISION🔒TEXT

保留已有强视觉空间,只训练文本侧去匹配;“冻结谁”本身就是训练配方。

SigLIP / 2023

独立 pair sigmoid

不再把整个 batch 放进同一个 softmax;每对图文独立做二元 sigmoid 分类。

CLIP-STYLEsoftmax(similarity matrix)

正确 pair 与 batch 内所有候选竞争。

SIGLIPΣ log σ(yᵢⱼ · scoreᵢⱼ)

每一对图文独立判断匹配 / 不匹配。

SigLIP-SO400M 后来成为 DeepSeek-VL2、Kimi-VL、K2.5 等模型的重要视觉初始化。 但一种更好的对齐损失不会自动解决动态分辨率、connector、语言生成或工具使用。 一手来源:ALIGNLiTSigLIP

06 CONNECTOR ERA I

Frozen 与 Flamingo:一个学视觉前缀,一个让语言层按需读视觉

早期路线的核心约束是:已有语言模型很强、训练一次很贵,能否少动它?答案产生了两种不同接口。

FROZEN / 2021视觉前缀
v₁v₂v₃
+
t₁t₂

视觉编码器学习产生连续 embedding,作为冻结 LLM 的前缀。语言模型保留能力,但视觉前缀承担重翻译任务。

FLAMINGO / 2022跨注意力读取
X-ATTNX-ATTN

Perceiver Resampler 把可变视觉特征压成固定潜变量,再用 gated cross-attention 插入冻结语言层之间。

真正要问

视觉信息是作为普通序列位置进入自注意力,还是保留在独立 memory 里让语言层跨注意力读取?两者的上下文成本和系统实现完全不同。

一手来源:Frozen ·Flamingo

07 CONNECTOR ERA II

BLIP-2 与 LLaVA:高效瓶颈和简单基线,各自买到了什么?

BLIP-2 / Q-FORMER
FROZEN
VISION
q1q2q3q4q5q6q7q8
FROZEN
LLM

固定 query 是效率,也是上限

Q-Former 用有限 query 从视觉特征取信息。训练参数少,但细粒度场景必须挤过固定瓶颈。

LLAVA / PROJECTOR
CLIP
VISION
LLM
TOKENS

架构简单,把重心交给数据

线性 / 两层 MLP projector 配合生成式视觉指令数据,成为开放 VLM 最易复现的路线之一。

01Caption

图里有什么

02Detailed description

局部、关系、文字

03Conversation

按用户意图回答

04Reason / Act

推理、工具与验证

COMMON MISTAKE

connector 参数少,不代表它不重要。它是视觉塔与 LLM 之间的带宽和坐标变换;信息能否被语言注意力使用,正由这里决定。

一手来源:BLIP-2 ·LLaVA ·LLaVA-1.5

08 RESOLUTION STRATEGIES

固定缩放、动态切图、NaViT packing:三种办法,三种不同债务

A / FIXED SQUARE

统一缩成正方形

batch 和吞吐最规则;长图被压扁、crop 丢边缘、小字最先消失。

系统简单 / 视觉损失高
B / DYNAMIC TILING

全局缩略图 + 局部 tile

复用固定视觉塔并保留细节;tile 重复、顺序与 Token 成本成为新问题。

局部清晰 / 上下文昂贵
C / NAVIT PACKING

把不同形状 patch 打包

保留长宽比,在固定 Token 预算内装多张图;需要 mask、位置与变长系统支持。

形状原生 / 系统复杂

NaViT 的关键不是“无限分辨率”,而是取消 batch 中所有图像必须同尺寸的假设。 DeepSeek-VL2 代表动态切图路线;MoonViT 代表 native-resolution packing 路线。二者都仍受最大 Token、显存与上下文约束。

09 OCR · DOCUMENTS

一页文档不是自然照片:它同时是像素、文字和二维程序

文档理解要求模型同时回答三件事:字符是什么?阅读顺序是什么?字符在表格、公式、标题和注释中扮演什么结构角色? OCR 错一位小数,后面的数学推理可以完全正确却得到错误答案。

01 / GLYPH
A 7 税 ∑
字符层

多语言、手写、公式、小字号与非语义字符串。

02 / ORDER
1243
阅读顺序

多栏、脚注、图例与复杂页面并非机械栅格扫描。

03 / STRUCTURE
结构层

表格 cell、键值关系、公式树与跨页引用。

04 / REASON
1,200
+ 84
= 1,284
推理层

读到事实后,还要计算、比较、验证和引用证据。

OCRBench 把文字识别、场景文字 VQA、文档 VQA、关键信息抽取与手写公式放在同一评测框架。 它提醒我们:只测自然图 VQA,会遗漏真实办公场景最常见的瓶颈。

10 VIDEO

视频不是“很多张独立图片”:时间本身也是证据

“杯子先掉下还是人先伸手”“红灯出现了多久”“哪个镜头解释了结局”,都不能只靠静态帧集合回答。 最直接的逐帧编码又会让视觉 Token 随帧数线性增长。

12345678
↓ SAMPLE / CHUNK
INPUT均匀采帧

便宜,但可能漏掉瞬间事件。

ENCODER时空注意力

表征强,训练与显存更贵。

BRIDGE时间池化

省 Token,也可能平均掉短动作。

LLM时间序列 Token

最通用,却直接竞争上下文。

同一 1,024² 帧 / P14 / 2×2 空间压缩
1 帧≈1,369 tokens
8 帧≈10,952
32 帧≈43,808

再做 4× 时间池化可把位置约降四倍,但不会免费保留所有短暂事件。

Video-MME 的评测包含短中长视频,并区分是否提供字幕和音频。 报告视频结果时必须同时记录采帧策略、最大帧数、字幕 / 音频与上下文预算。

11 WHAT DOES “NATIVE” MEAN?

“原生多模态”不是行业统一开关,至少要拆成五个维度

厂商可以用“native”描述输入、数据、架构或训练。若不拆词,我们会把“早期加入图像”“图文共同 NTP”“没有事后 alignment” 和“能视觉工具闭环”误当成同一个命题。

01 / DATA数据原生

视觉数据是否从预训练早期进入,而非只在末期补课?

02 / TARGET目标原生

视觉塔是否与主干共享生成目标或同一训练制度?

03 / OPTIMIZE优化原生

视觉塔与语言主干是否共同更新,而非只学一个事后 bridge?

04 / I-O输入输出原生

图、文、视频、代码和渲染能否在同一序列交错?

05 / AGENT行为原生

动作后能否重新看环境,继续推理并验证?

原生多模态 = 没有视觉塔错误
原生多模态 = 没有 projector错误
原生多模态 = 数据、目标、优化与闭环更早、更深统一可核验

K3 明确保留约 0.4B 的 MoonViT-V2 与轻量 MLP projector。它的“原生”重点是从头共同 next-token prediction、 无 post-hoc modality alignment,以及视觉在长程工具轨迹中的持续回流。

12 FOUR KINDS OF UNIFICATION

统一序列、统一主干、统一目标、统一行为,是四件事

U1
统一输入序列

图像 Token 与文字 Token 可以交错。

Chameleon · LLaVA
U2
统一 Transformer 主干

不同模态共享大部分计算层。

SOLO · Janus
U3
统一或协同目标

共同 NTP,或在同一主干混合 NTP 与 diffusion / flow。

K3 · Transfusion
U4
统一行为闭环

理解、生成、工具动作和重新观察进入一条轨迹。

K3 · visual agents
CHAMELEON

全部离散化

TTVVTV

图文交错离散 Token,用 early-fusion 自回归统一建模。图像 tokenizer 质量和长视觉序列成为代价。

TRANSFUSION

主干统一,损失分流

NTP
TEXT
ONE
TRANSFORMER
DIFFUSION
IMAGE

文字做 next-token prediction,连续图像做 diffusion;统一主干不要求统一输出表示。

JANUS

主干统一,编码解耦

UNDERSTANDAR
BACKBONE
GENERATE

理解与生成使用不同视觉编码路径,避免语义鲁棒表征与像素可逆表征互相拉扯。

一手来源:Chameleon ·Transfusion ·SOLO ·Janus

13 DEEPSEEK SPOTLIGHT

DeepSeek 的多模态工作不是一条直线,而是三条不同问题分支

把 DeepSeek-VL、Janus、OCR 画成单向“代际升级”会误导:VL 系列优化高分辨率理解, Janus 探索理解与生成怎样共用主干,OCR 系列研究二维视觉能否成为长上下文压缩介质。

BRANCH A真实世界理解
DeepSeek-VLDeepSeek-VL2

固定混合编码器 → 动态 tile;高分辨率、OCR、MoE 与语言能力保持。

输出中心:文字理解
BRANCH B统一理解与生成
JanusJanusFlowJanus-Pro

解耦视觉编码路径,共享自回归主干;离散生成与 rectified flow 分叉。

输出中心:文字 + 图像
BRANCH C光学上下文压缩
DeepSeek-OCROCR2

文字渲染成二维页面,用视觉 Token 压缩;再让语义重排改善阅读顺序。

研究中心:压缩与解码
WHY THREE BRANCHES MATTER

同一组织的论文可以共享模型、数据和工程经验,但只要优化目标不同,就不能拿“新年份”替代架构比较。

14 DEEPSEEK-VL → VL2

从双视觉尺度到动态 tile:高分辨率怎样进入稀疏语言骨干

DeepSeek-VL 面向网页截图、PDF、OCR、图表与真实用例, 使用混合视觉编码器处理 1024² 输入。它尤其强调:视觉预训练一开始就保留语言数据,主动管理视觉—语言竞争,避免语言能力被覆盖。

DEEPSEEK-VL / 2024

两个尺度看同一张图

384
semantic
1024
detail
LLM
  • 混合视觉编码器
  • 1024² 真实场景输入
  • 预训练早期混入语言数据
DEEPSEEK-VL2 / 2024

全局缩略图 + 最多九个局部 tile

SigLIP
384
  • 候选网格满足 m·n ≤ 9
  • 每 tile 729 embedding
  • 2×2 pixel shuffle 后 196 Token
01Dynamic tiles

全局缩略图 + 局部视野

02SigLIP-SO400M-384

固定视觉编码尺寸

032×2 shuffle

729 → 196 / tile

042-layer MLP

映射到语言空间

05DeepSeekMoE + MLA

稀疏语言骨干

PARAMETER HYGIENE

VL2 论文列出的 1.0B、2.8B、4.5B 是不同版本的激活参数量,不能与总参数混用。动态 tile 也不是任意无限切图:论文候选约束为 m·n ≤ 9

15 JANUS FAMILY

为什么“看懂一张图”和“生成一张图”可能不该共用同一视觉入口

UNDERSTANDING WANTS语义稳定
  • 同一对象跨风格仍接近
  • 忽略不重要像素噪声
  • 方便与语言概念对齐
VS
GENERATION WANTS细节可逆
  • 保留纹理与颜色
  • 保留精确空间布局
  • 能解码回高质量像素
UNDERSTAND
Semantic encoder

更关心概念与关系

GENERATE
Generation encoder

更关心可恢复视觉细节

↘   ↙
SHARED COREONE AUTOREGRESSIVE TRANSFORMER

文字与视觉生成序列在主干中统一

Janus

解耦理解与生成视觉编码路径,保留统一自回归主干。

JanusFlow

语言自回归 + 图像 rectified flow,并对两种表示做对齐。

Janus-Pro

延续基本架构,改进训练策略、数据与规模。

“统一模型”在这里不等于“一个视觉编码器包办全部”。一手来源:Janus ·JanusFlow ·Janus-Pro

16 DEEPSEEK-OCR · OCR2

最反直觉的一条 DeepSeek 路线:把文本先画成图,再用视觉 Token 压回去

这不是为了把已有数字文字变得更清晰,而是在问:二维页面能否像人类速览一页纸那样, 用远少于原始文本序列的位置保留足够信息?

TEXT CONTEXT长文字 Token 序列
RENDER →
2D PAGE把顺序压进空间
ENCODE →
VISION TOKENS更短视觉序列
DECODE →
OCR OUTPUT恢复文字与结构

压缩越强,解码错误通常越多。

DEEPENCODER / ≈380M
SAM-base≈80M · 高分辨率局部
CLIP-large≈300M · 语义压缩
16× downsample4096 → 256 positions @ 1024²
<10× COMPRESSION≈97%

论文报告的解码精度区域

20× COMPRESSION≈60%

论文报告的更强压缩区域

100 VISION TOKENS作者报告优于 GOT-OCR2.0

OmniDocBench 特定设置

A100-40G>200K pages / day

论文生产管线报告值

AUTHOR-REPORTED, NOT A LAW

压缩率依赖文本 tokenizer、渲染、字体、语言、页面版式、视觉 Token 定义与解码目标。上述数字不是本站复测,也不代表任意文档。

OCR2:阅读顺序本身也可以学习

SEMANTIC REORDER →
123456
标题 → 左栏 → 图注 → 表格 → 右栏

DeepSeek-OCR2 用 DeepEncoder V2 根据图像语义动态重排视觉 Token, 把问题描述为两个串联的一维因果结构:视觉侧决定读取序列,语言侧沿该序列解码。 这改善序列组织,但不等于二维结构已被完全解决。

17 KIMI SPOTLIGHT

Kimi 三代 MoonViT 的主线,不是“像素越来越大”,而是训练制度越来越统一

KIMI-VL

MoonViT

INIT
SigLIP-SO400M
OBJECTIVE
SigLIP + caption
ALIGN
0.1T 显式对齐
VIDEO
长上下文输入
KIMI K2.5

MoonViT-3D

INIT
SigLIP continual
OBJECTIVE
caption NTP
ALIGN
ViT / projector bridge
VIDEO
共享参数 + 时间池化
KIMI K3

MoonViT-V2

INIT
从头训练
OBJECTIVE
共同 NTP
ALIGN
无 post-hoc stage
VIDEO
共享参数 + 视觉闭环
THE REAL LINEAGE

对齐一个强视觉塔用生成目标统一图像 / 视频从头共同优化视觉塔与超大 MoE 主干

18 KIMI-VL

MoonViT:把 NaViT 原生分辨率、SigLIP 语义和稀疏 MoE 接到一起

INPUT
不同分辨率 / 长宽比

NaViT packing

VISION
MoonViT ≈400M

SigLIP init · abs pos + 2D RoPE

COMPRESS
2×2 pixel shuffle

空间位置约降 4×

PROJECT
2-layer MLP

视觉 → 语言维度

BACKBONE
Moonlight 16B

约 2.8B 激活 MoE

独立视觉阶段的目标

L = LSigLIP + 2 × Lcaption图文对比让表示具有开放语义,图像条件 caption 让视觉塔朝生成式任务靠近。

从 5.2T 纯文本主干到额外 4.4T 多模态训练

LANGUAGE START5.2T text

Moonlight 中间 checkpoint

VIT + ALIGN2.0T + 0.1T

MoonViT / projector

JOINT1.4T

图文联合预训练

COOLDOWN0.6T

高质量分布

LONG0.3T

8K → 128K

这些数字来自 Kimi-VL 官方论文。 这一代已经做联合预训练,却仍有独立 ViT 与 0.1T alignment,因此不属于 K3 定义的“无事后对齐”。

19 KIMI K2.5

MoonViT-3D:图像和视频共享;zero-vision 只发生在 SFT

t1t2t3t4
SPATIAL帧内注意力

每帧内部对象与布局

+
TEMPORAL帧间注意力

动作顺序与变化

POOL4× 时间压缩

四帧 patch 轻量聚合

KIMI-VLSigLIP contrastive + caption CE

视觉语义对齐 + 生成目标

K2.5caption CE only

图像 / 视频条件 next-token generation

“zero-vision SFT”最容易被误读

PRETRAIN≈15T vision-text

图像 / 视频早已进入基础能力

SFTtext-only

用 IPython 程序操作激活视觉工具行为

RLvisual outcome tasks

grounding、counting、文档、图表与 STEM

ZERO-VISION ≠ NO VISION DATA

“zero-vision”只修饰 SFT。K2.5 预训练约 15T 图文 Token,之后的 outcome-based RL 也使用视觉任务。作者还报告部分文本基准在视觉 RL 后提升,但这不是普遍规律。

一手来源:Kimi K2.5 Technical Report

20 KIMI K3 · NATIVE MULTIMODALITY

K3 的关键变化:不再把视觉塔事后嫁接到已经成型的语言主干

K3 报告把语言与视觉从训练开始共同优化,以 next-token prediction 作为共同训练制度, 并取消 post-hoc modality-alignment stage。视觉、代码、渲染物和新观察还能在百万 Token 级 Agent 轨迹里反复交错。

POST-HOC CONNECTOR REGIME
TEXT-ONLY LLMVISION TOWERALIGN BRIDGEMULTIMODAL SFT

语言主干先成型,视觉通过独立阶段找入口。

K3 NATIVE REGIME
TEXT DATA+VISION DATAJOINT NTPVISUAL AGENT LOOP

视觉塔、projector 与 2.8T MoE 主干在共同目标下从训练早期协同。

DEPTH27 layers

Vision Transformer

SIZE≈0.4B

MoonViT-V2

NORMRMSNorm

无 bias

IMAGE / VIDEOshared

空间 / 时间分解注意力

SPATIAL4× fewer

2×2 pixel shuffle

MAX IMAGE≈3584²

报告支持上限

K3 把像素直接塞进 LLM错误
K3 不需要视觉 projector错误
MoonViT-V2 → 轻量 MLP → LLM报告架构

一手来源:Kimi K3 Technical Report

21 FROM-SCRATCH VISION

为什么放弃一个强 SigLIP 初始化?K3 的答案来自联合优化稳定性

K3 报告称,在与 2.8T MoE 主干联合训练的消融中,SigLIP 初始化的 MoonViT-3D 持续出现更高梯度范数和更多尖峰; 从头训练的 MoonViT-V2 梯度更低、更平稳,并在其视觉评测中达到相当能力。

HIGHgradient normLOW
MoonViT-3D · SigLIP initMoonViT-V2 · from scratch
OBSERVATION报告曲线

SigLIP 初始化视觉塔梯度更高、尖峰更多。

AUTHOR CONCLUSION本配方不需要对比初始化

从头 NTP 可达到相当视觉评测。

NOT PROVEN所有 VLM 都应从头训练

架构、规模、数据和优化器改变后结论可能变化。

图中只复现论文主张的趋势,不重绘原始数值。正确表述是“在 K3 的训练消融中”,而不是“SigLIP 初始化普遍不稳定”。

22 PROGRAMMATIC MULTIMODAL DATA

当代码能渲染世界,多模态数据就不再只是“图片配一句话”

K3 扩大程序化多模态数据,把代码与其可渲染产物绑在一起:SVG、3D、Web、游戏、CAD、动效和视频编辑。 这些样本天然包含可执行规格、视觉结果与可修改源程序。

SPEC
“做一个可交互的轨道图”

自然语言需求与约束

CODE
<svg>
  <path ... />
</svg>
可执行中间表示

HTML / SVG / JS / CAD

RENDER
视觉结果

模型可以重新观察

VERIFY / EDIT
比较规格并修改

形成视觉闭环

01SVG
02WEB
033D
04GAME
05CAD
06MOTION
WHY THIS CHANGES TRAINING

传统 caption 只告诉模型“图里有什么”;程序化样本还能告诉它“怎样产生、怎样修改、怎样验证这个视觉结果”。这把理解、生成、代码和 Agent 行为接到同一数据闭环。

23 INTERACTIVE LAB

现在亲手调分辨率、训练制度、光学压缩与视觉工具闭环

前三个实验分别抓住容量、训练和压缩;第四个实验专门证明“文字思考更长”和“主动获得新视觉证据”不是同一种测试时计算。

INTERACTIVE / MULTIMODAL LAB

像素进来以后,亲手拨动四个真正的瓶颈

Token 数和训练制度是确定性教学模型;DeepSeek-OCR 曲线中的插值会明确标注, 不冒充论文实测。实验的目标是建立量纲与边界,而不是模拟某个真实模型分数。

TOKEN BUDGET

分辨率翻倍,为什么视觉 Token 接近四倍?

这里按正方形图像和规则 patch 计算。真实模型还可能加入缩略图、tile、分隔符、padding 与动态 packing。

空间压缩
时间池化
01 / PIXELS1.05M

进入视觉预处理的像素

02 / RAW PATCHES5,476

ceil(H/P) × ceil(W/P) × frames

03 / VISUAL TOKENS1,369

空间与时间压缩后的教学近似

04 / CONTEXT SHARE1.0%

尚未计算文字、工具结果与输出

预算判断适中:视觉尚未主导上下文

单图细节与长文字仍有较大共存空间。

代价转移2×2 合并节省约 75% 视觉位置

Token 变少不是免费信息压缩:小字、细线和短暂事件更容易丢失。

HOW TO READ 所有架构事实来自对应一手论文;交互中的 meter、置信度和未报告区间插值仅用于形成直觉。

24 MULTIMODAL HALLUCINATION

模型为什么会描述出图里不存在的东西?因为答案来自证据与先验的竞争

VISUAL EVIDENCE
  • resize 丢小目标
  • connector 压缩
  • 遮挡 / 模糊
VS
LANGUAGE PRIOR
  • 厨房常有微波炉
  • 训练描述常共现
  • 流畅答案得到偏好
01 / INPUT LOSS像素证据已经没了

缩放、裁剪、采帧与图像质量。

02 / INTERFACE LOSS视觉塔看见但没传过去

query、projector、Token 压缩与注意力。

03 / GENERATION BIAS常见答案比视觉更“顺”

语言先验、共现、奖励与解码。

POPE 用对象存在性轮询诊断幻觉;HallusionBench 进一步用控制组问题拆开语言幻觉、视觉错觉、回答倾向和逻辑一致性。 单个 yes/no 分数不能覆盖属性、关系、OCR 与长回答忠实度。

SEE提高有效视觉证据

动态分辨率、裁剪、负例、密集描述。

GROUND绑定位置与引用

region、bbox、OCR span、证据截图。

ACT允许主动再看

zoom、OCR、Python、检索与工具。

VERIFY独立检查

计算、规则、环境 final state 与拒答。

25 EVALUATION MAP

一个多模态总分,会把感知、OCR、知识和推理揉成无法诊断的平均数

BENCHMARKPERCEPTIONOCRKNOWLEDGEREASONVIDEO
MMBench
MMMU
MathVista
OCRBench
Video-MME
MMMU11.5K questions

6 大学科、30 学科、183 子领域、30 种图像类型。

MATHVISTA6,141 examples

28 个已有数据集 + 3 个新数据集。

OCRBENCH29 datasets

识别、VQA、KIE 与手写公式。

VIDEO-MME900 videos

254 小时、2700 问答,短中长视频。

REPORT THE WHOLE CONFIGURATIONcheckpoint + preprocessing + max pixels / frames + prompt + context + tools + evaluator + score

同名模型若 tile、帧数、字幕或工具预算不同,就不是同一个评测条件。

26 VISUAL AGENTS

从回答一张图到改变桌面:视觉输入一旦进入行动闭环,安全边界也跟着扩大

LEVEL 1Single-shot VQA

一次图像观察 → 文字答案

验证:参考答案
LEVEL 2Visual tool reasoning

crop / OCR / Python → 新观察

验证:计算或证据
LEVEL 3GUI / environment Agent

连续截图 → 鼠标 / 键盘 / 代码

验证:环境 final state
OBSERVE截图 / 图片 / 视频
REASON目标、证据、下一动作
ACTcrop / code / click / type
NEW STATE环境改变并返回新视觉

VisualWebArena 把视觉网页任务放进可执行网站;OSWorld 使用真实桌面应用与执行式验证。 此时“看懂截图”不等于“坐标落对”,更不等于“跨应用最终状态正确”。

TRUSTED用户目标与系统策略

决定允许的目标、权限与审批。

UNTRUSTED网页 / 文档 / 图片文字

可能包含间接提示注入,不能自动升级为指令。

CONTROLLED工具接口与执行环境

最小权限、可回滚、可审计与独立验证。

27 SYSTEMS · MOE

动态图像让训练 batch 变得不规则;稀疏 MoE 又把不规则传给路由与通信

VARIABLE LENGTH
样本计算量差异

长图、长视频和多图样本形成 straggler。

PACKING
padding 与碎片

按视觉 Token 分桶、NaViT / sequence packing。

PIPELINE
ViT 与 LLM 耗时不同

K3 报告把部分 ViT 工作塞进 pipeline bubble。

ROUTING
视觉 Token 专家负载

路由专化、热点与稳定性仍缺公开细证据。

01视觉 Token 分桶
02动态 batch
03Patch / sequence packing
04Context parallel
05限制最大像素 / 帧
06ViT / LLM 重叠调度
THROUGHPUT HYGIENE

Kimi-VL 与 K3 的吞吐或 bubble 隐藏结论都依赖硬件、精度、batch、分辨率分布、并行拓扑和比较基线,只能写成各自配置下的作者报告。

视觉 Token 进入 MoE 后是否形成稳定“视觉专家”,当前公开证据不足。本章把它列为开放问题,不从少量路由热图猜测语义专化。

28 AUDIT CHECKLIST

以后再看到一款“原生多模态旗舰”,用这十问把宣传词还原成技术事实

01

输入

最大像素、tile、帧数、字幕 / 音频和 context 分别是多少?

02

视觉塔

从什么 checkpoint 初始化?固定还是更新?图像与视频是否共享?

03

压缩

patch、pixel shuffle、resampler、时间池化分别丢掉什么?

04

连接器

prefix、cross-attention、Q-Former、MLP,还是单主干?

05

训练

哪些阶段使用对比、caption、NTP、SFT、RL?谁被更新?

06

“原生”

数据、目标、优化、输入输出、Agent 五维究竟满足哪些?

07

输出

只生成文字,还是也生成图像、代码、工具动作和新观察?

08

评测

感知、OCR、知识、推理、视频与 Agent 是否分别记录?

09

系统

视觉 Token 怎样打包、并行和限制长尾?吞吐基线是什么?

10

安全

图像文字被当作数据还是指令?工具副作用怎样授权和验证?

STILL OPEN

当前没有定论的问题

  • 从头训练视觉塔的稳定性结论,能否跨规模、数据和架构复现?
  • 视觉 Token 在稀疏 MoE 中是否产生稳定、可迁移的专家专化?
  • 光学上下文压缩何时优于文本 tokenizer、KV 压缩或外部 memory?
  • 视觉 RL 对文本任务的正迁移,来自算法、数据难度还是 reward 结构?
  • vision-in-the-loop 的收益中,模型、工具、harness 与 verifier 各占多少?
YOU NOW HAVE THE MAP

从像素到视觉 Token,从 CLIP 语义到 connector,从高分辨率、文档和视频到统一理解生成, 再从 DeepSeek 三分支与 Kimi 三代 MoonViT 走到视觉 RL、Agent、安全与系统。 你现在可以不依赖营销命名,逐层解释一款多模态模型到底改变了什么。

PRIMARY PAPER CHAIN

本章的一手论文链

正文只保留改变表示、接口、训练目标、系统策略或评测方法的关键节点。所有链接直达论文或正式会议页面; 报告数字不做跨模型无条件横比。

AlexNet

GPU 与大规模卷积视觉表示的转折点。

ResNet

残差连接让深视觉骨干更易优化。

Vision Transformer

把图像切成 patch,进入标准 Transformer 序列。

ALIGN

把噪声 web 图文对扩到超大规模。

CLIP

自然语言监督的开放视觉语义空间。

Frozen

视觉前缀接入冻结语言模型。

LiT

锁定图像塔,只调文本侧对齐。

BLIP

captioner 与 filter 重建图文数据质量。

Flamingo

Perceiver Resampler 与 gated cross-attention。

BLIP-2

Q-Former 连接冻结视觉塔与冻结 LLM。

SigLIP

用独立 sigmoid pair loss 取代 batch softmax。

LLaVA

简单 projector 与生成式视觉指令调优。

MiniGPT-4

少量高质量对话对齐冻结视觉与语言模块。

InstructBLIP

instruction-aware Q-Former 与任务泛化。

PaLI-X

多语言视觉—语言模型的组件、任务混合与规模扩展。

OCRBench

识别、DocVQA、KIE 与公式的综合 OCR 评测。

POPE

用轮询式问题诊断对象幻觉。

Kosmos-2

用 location token 把文字指称落到视觉区域。

NaViT

在 Token 预算内打包任意长宽比图像。

MMBench

双语多选与 CircularEval 综合评测。

Qwen-VL

OCR、grounding 与开放视觉对话路线。

LLaVA-1.5

两层 MLP、数据混合与工程基线。

MathVista

视觉上下文中的数学推理。

HallusionBench

语言幻觉、视觉错觉与一致性诊断。

Video-LLaVA

图像与视频的共同视觉—语言空间。

MMMU

大学级多学科视觉理解与推理。

LLaMA-VID

内容 / 上下文 Token 压缩长视频。

RLHF-V

用细粒度人工纠错与 dense DPO 对齐视觉忠实度。

VisualWebArena

真实网站中的视觉 grounding Agent。

DeepSeek-VL

真实场景、高分辨率与语言能力保持。

MM1

系统研究架构、数据和训练配方的相对作用。

InternVL 1.5

6B 视觉塔、最多 40 个动态 tile 与双语高质量数据。

OSWorld

真实桌面截图、动作与执行式验证。

Chameleon

图文交错离散 Token 的 early-fusion 模型。

Video-MME

短中长视频、字幕与音频条件评测。

Visual Sketchpad

用画线、框选和视觉工具产生可回看的视觉思维步骤。

JEST

按 batch 联合可学习性筛选多模态训练样本。

SOLO

单一 Transformer 视觉—语言训练配方。

LLaVA-OneVision

单图、多图、视频统一迁移路线。

Transfusion

同一主干混合文字 NTP 与图像 diffusion。

Qwen2-VL

动态视觉 Token、M-RoPE 与统一图像 / 视频处理。

Janus

解耦理解 / 生成视觉编码路径。

JanusFlow

自回归语言与 rectified flow 图像生成。

InternVL 2.5

从模型、数据与测试时三个轴扩展开放多模态模型。

DeepSeek-VL2

动态 tile、pixel shuffle、MoE 与 MLA。

Janus-Pro

优化训练阶段、数据和规模。

Qwen2.5-VL

从头训练动态分辨率 ViT、绝对时间编码与视觉 Agent。

Vision-R1

大规模 RL 激活多模态推理。

Kimi-VL

MoonViT 原生分辨率与稀疏 MoE。

VTool-R1

强化学习训练自主视觉工具调用。

DeepSeek-OCR

把二维视觉表征用作长上下文压缩介质。

DeepSeek-OCR2

依据图像语义动态重排视觉 Token。

Kimi K2.5

MoonViT-3D、zero-vision SFT 与视觉 RL。

ToolsRL

面向视觉工具使用的强化学习。

Kimi K3

MoonViT-V2 从头共同 NTP 与视觉闭环 Agent。