中国政策档案 Governance Archive HOLDINGS 235,224 · FONDS 122
Record · qbitai ACC. 900073312

New Work by Liu Zhuang and Chen Danqi: Open-Source General Visual Reasoning RL Framework Achieves SOTA with Zero Thinking Data

刘壮陈丹琦新作:开源通用视觉推理RL框架,0思考数据刷新SOTA

Issuer
Date
2026-04-11
Instrument
other
Cited by
0
This article reports on the release of Vero, an open-source reinforcement learning framework for general visual reasoning developed by Princeton researchers Liu Zhuang and Chen Danqi. The framework achieves state-of-the-art results on 8B vision-language models across 30+ benchmarks using a single-stage RL approach with task-routed rewards.
Full text · 原文 1,807 字
鱼羊 发自 凹非寺<br> 量子位 | 公众号 QbitAI<br> 适用于通用视觉推理的强化学习(RL)框架,终于有开源版本了!<br> 来自普林斯顿刘壮团队,陈丹琦亦参与其中。<br> 项目名Vero,基于这一方案构建的视觉推理器,能够胜任图表、科学、空间理解和各种开放视觉任务,在30多项测试中达到了8B视觉语言模型的SOTA。<br> 在此之前,尽管GPT、Gemini等最强大模型们已经把视觉推理玩出了花,但其背后的强化学习方案还是各大厂商的“独门秘籍”,开源方案们大多只能覆盖特定视觉任务。<br> 而Vero的出现,用项目负责人刘壮的话说,证明了“即使在学术环境下,只要有合适的人才和投入,我们也能够追赶上顶尖工业界团队所取得的部分成就”。<br> 用于视觉推理的开源RL方案<br> 想要打造全能型的看图推理“高手”模型,通常会遇到两类问题。<br> 其一,是基于开源RL方案,VLM往往只擅长某一种任务,比如数学题、图表,换个任务就抓瞎。<br> 其二,如果拿多种任务一起训练VLM,模型还容易出现越学越乱、越学越崩的现象。<br> Vero团队发现,背后的原因在于,不同的视觉任务会放大不同的推理策略,比如图表QA需要数值提取和比较,而定位任务则需要空间扫描和绑定。<br> 针对这些问题,Vero团队主要做了三件事。<br> Vero-600K数据集<br> 首先,研究人员从59个数据集中精心挑选、过滤并构建了一个包含60万高质量样本的多样化训练集。<br> 这些样本被分为六类:<br> 图表与OCR(Chart & OCR)<br> STEM<br> 空间与动作(Spatial & Action)<br> 知识与识别(Knowledge & Recognition)<br> 定位、计数与搜索(Grounding,Counting & Search)<br> 描述与指令遵循(Captioning & Instruction Following)<br> 研究人员发现,单任务RL训练出来的模型无法实现可靠的泛化,针对某一类别的训练往往会降低模型在其他任务上的表现。<br> 相比之下,在广泛且均衡的数据集上进行RL训练, 模型能够学到通用的视觉推理模式,避免了在单一任务上训练导致的能力退化。<br> 任务路由奖励机制(Task-Routed Rewards)<br> 在视觉推理中,不同任务的答案格式之间其实存在很大的差异。<br> 为此,Vero提出了任务路由奖励机制:设计了一套多路奖励系统,能根据任务类型的不同,自动把输出路由给相应的验证器,来分别计算奖励。<br> 比如,对于选择题,评分标准是选项选得是否正确;对于数学题,则需要数学校验;对于开放描述,Vero会引入另一个大模型作为裁判,来评估回答的质量。<br> 单阶段强化学习<br> 相比于闭源模型依赖于私有“Thinking”数据的强化学习方案,Vero提出:<br> 只要拥有高质量的数据过滤、均衡的任务混合,以及精确的路由奖励,仅仅通过单阶段强化学习,就能激发基础模型的通用视觉推理能力。<br> 实验结果显示,在没有引入任何私有“思考”数据的情况下,基于Vero训练的模型在30个基准测试中的23项上,超越了经过专门微调的Qwen3-VL-8B-Thinking。<br> 研究团队的消融实验还表明:<br> 广泛的数据覆盖是视觉推理强化学习Scaling的主要驱动力。<br> 目前,Vero的所有数据、代码、模型均已开源。<br> 研究团队<br> Vero的两位通讯作者是Gabriel Sarch和Linrong Cai。<br> Gabriel Sarch博士毕业于CMU,目前是普林斯顿大学PLI(Princeton Language and Intelligence)的博士后研究员——<br> 论文的作者之一陈丹琦,现在也是PLI的副主任。<br> Linrong Cai,天津第一中学校友。本科毕业于威斯康星大学麦迪逊分校,目前正在攻读普林斯顿大学计算机科学专业硕士学位,师从刘壮。同时Gabriel Sarch也是他的mentor。他的研究方向是视觉语言模型中的推理。<br> 刘壮则是Vero的项目负责人。刘壮本科毕业于清华姚班,后于加州大学伯克利分校获得博士学位,现在是普林斯顿大学计算机科学助理教授。<br> 在CVPR 2017上,刘壮的一作论文DenseNet获得了最佳论文奖。ConvNeXt则是他在Meta FAIR任高级研究科学家期间,和谢赛宁合作发表的成果。<br> 在Meta期间,刘壮和何恺明、LeCun等亦有深度合作。<br> 项目地址:<br> https://vero-reasoning.github.io/