Back to Blog VBVR-Pro:让模型用

VBVR-Pro:让模型用"画图"来思考,再用可验证的奖励教它画对

Paper
arXiv 2608.26105 · NTU / CUHK / Berkeley / Stanford / JHU 等 50+ 人协作 · 2026-08-26
arxiv.org/abs/2608.26105 · 官网 video-reason.com · 数据/模型/scorer/代码全开源
一句话:视觉生成不是输出,是推理媒介。VBVR-Pro 用 300 个程序化任务 + 规则化可验证奖励 + RLVR,把"画图思考"从口号做成了可训练、可验证、可归因的闭环。

一、核心主张:视觉状态是解题的草稿纸

语言模型思考靠 token 链,那视觉模型能不能靠"画图链"思考?这篇论文的立场很激进:图像和视频不只是给模型"看"的输入或给人"欣赏"的输出,而是解题的草稿纸——中间视觉状态就是推理过程本身。这条路叫 native visual reasoning。

它卡在三个瓶颈:没有可扩展的训练任务、没有可靠的反馈信号、没有跨模态的受控比较。VBVR-Pro 的全部工作就是补齐这三块:可训练(300 任务)→ 可验证(规则 scorer)→ 可优化(RLVR)→ 可归因(模态对照)

VBVR-Pro 闭环总览:300 任务 + 可验证 scorer + RLVR + 模态对照
VBVR-Pro 闭环总览:300 任务 + 可验证 scorer + RLVR + 模态对照 — 30+ 生成器在同一任务分布下受控比较,scorer 兼任评测与 RL 奖励

二、任务层:300 个生成器,125 万实例,零标注

任务按五种认知能力组织:感知、空间、变换、抽象、知识。每个任务是一个参数化程序——随机网格、物体数量、布局、外观,配一个确定性求解器自动算出标准答案,零人工标注。300 个生成器里 150 个来自前作 VBVR,150 个为新设计(中位颜色连通域 80 个 vs 旧任务 12 个,复杂度高一个量级)。

规模:347 万图像、130 万视频、125 万训练实例,50 个任务整个留作域外评测。最关键的设计决策是:同一题目渲染成对齐的视频版与图像版——不是两个数据集,是同一问题的两种模态化身,这才让后面的模态对照实验成立。

五大认知能力的代表性任务:感知、空间、变换、抽象、知识
五大认知能力的代表性任务:感知、空间、变换、抽象、知识 — 跨任务可携带多个能力标签,从画布基元到棋盘博弈

三、反馈层:VLM 裁判不靠谱,规则 scorer 才能当奖励

论文对 VLM-as-a-judge 的批评相当系统。三种典型失败:数值不精确(颜色混合错了,三个裁判最低也给 0.80,规则 scorer 给 0.40)、忽略决定性细节(该保持的圆环大小变了还打高分)、误解任务规则(正确答案被压到 0.24)。更麻烦的是不可复现:温度设 0,同一批视频重复打分,VLM 有 55-93% 的样本分数会变——当评测指标已够糟,当 RL 奖励就是灾难。

方案是为 100 个评测任务各写一个规则 scorer:用 HSV 分割、轮廓检测、OCR、轨迹跟踪等经典 CV 方法提取语义属性,在属性层打分而非像素层。软指标加权求和,硬约束(如迷宫不许穿墙)乘法门控。结果全维度碾压:与人类偏好一致率超 0.60(GPT-5.5 仅 0.54,Gemini-3.1-Pro 0.52),成本最低,完全确定性,OOD 模型排序与人类相关性 Spearman ρ=1.00。

VLM 裁判的两种失败:忽视细节(同心圆环任务)与误解规则(图案补全)
VLM 裁判的两种失败:忽视细节(同心圆环任务)与误解规则(图案补全) — 规则 scorer(左下角分值)与 GPT-5.5 / Qwen-3.7 / Gemini-3 打分形成鲜明对比
人工偏好一致率 vs 单次评测成本(对数轴)
人工偏好一致率 vs 单次评测成本(对数轴) — 规则 scorer 一致率最高且成本最低;GPT-5.5 与 Gemini-3.1 花钱更多、一致率反而更低

四、机制层:视觉轨迹比文本链更能承载推理

这是全文最有味道的部分。用同一套任务训练 30 多个生成器后——

视频 vs 交错图文 vs 单图。直觉上视频应全面胜出,但训练后最强的交错图文模型(SenseNova-U1)在域内与最强视频模型(Wan2.2)打平——学过任务结构后,稀疏的关键视觉状态就够用,计算还便宜得多。视频的真正优势在变换类任务和域外泛化:需要持续跟踪状态转移时,稠密时序表征不可替代。单图生成全面垫底——一张终点图装不下多步过程。

消融才是铁证。把中间多帧图像压成单帧,掉分明显;把中间推理文本换成无意义占位符,几乎不掉分。中间视觉状态是主角,中间文本是配角——与语言模型里"CoT 文本承载推理"恰好镜像。

反事实干预更直接:删输入图像,0.638 → 0.064;删中间图像 → 0.099;中间图像加噪 → 0.190。中间视觉状态被模型因果性地使用,不是装饰。

Chain-of-Step:去噪过程中的多路径探索与叠加态探索
Chain-of-Step:去噪过程中的多路径探索与叠加态探索 — 视频模型通过连续运动、交错模型通过在图像空间直接画候选路径来探索

五、优化层:RLVR 真涨分,还让模型学会"改答案"

RL 采样的算法选择很巧妙:标准 Flow-SDE 加大随机性会把画面打得稀烂,他们改用系数保持采样(CPS),既保画面质量又产生足够的语义探索多样性。

同一数据、同一算法、只换奖励源:SFT 0.503 → RLVLM(VLM 打分当奖励)0.508,几乎白给;RLVR(规则 scorer 当奖励)0.548,域外也从 0.328 涨到 0.377——RLVR 在没见过任何域外任务的条件下提升了泛化。奖励信号质量直接决定 RL 上限。

更有意思的是行为变化:RLVR 后的模型在去噪早期答错,会在后续步骤自我修正收敛到正确答案(pre-RL 模型第一步就定死不改);迷宫轨迹连贯性也显著变好。同等计算预算下,RL 把推理视界拉长了

RLVR vs RLVLM 训练曲线:Overall / In-Domain / Out-of-Domain
RLVR vs RLVLM 训练曲线:Overall / In-Domain / Out-of-Domain — RLVR 稳定上升,RLVLM 很快停滞且在 400-500 步出现回落

六、迁移:不是背题

VBVR-Pro 训练的 Wan2.2 在七个外部基准(RISE-Video、V-ReasonBench、MME-CoF-Pro 等)上最高提升 20 个百分点。最近邻分析显示测试题与训练集在 CLIP / DINOv2 / 文本特征空间里都不相似——涨的是可复用的视觉推理操作,不是指令模板拟合。

七、为什么值得读

对做视频理解/检索的人,三个可搬走的结论:

① 评测设计:生成式输出别用 VLM 当裁判,属性级规则 scorer 更准、更便宜、可复现,还能直接当 RL 奖励。
② 模态选型:需要状态跟踪选视频,性价比选交错图文,单图生成别指望过程推理。
③ 范式信号:如果推理可以发生在视觉状态空间里,那"视频语义检索"的终局可能不是"文本描述视频",而是直接在视觉轨迹上推理——模型的中间产物本身就是可检索、可验证的语义单元。

Tags: #Blog