2 minute read

大语言模型(LLM)通过思维链(Chain-of-Thought, CoT)成功实现了”慢思考”(System 2)。然而,在面对复杂的视觉问答、几何推导与高分辨率图像理解时,传统的纯文本 CoT 经常沦为”盲人摸象”。
本文将系统梳理 视觉思维链(Visual Chain-of-Thought, Visual CoT) 的发展脉络——从早期的文本中心化两阶段推理,到显式空间定位(Grounding),再到当前由强化学习(RL, 如 GRPO)驱动的主动视觉感知与动态交互。


引言:为什么视觉领域需要”思维链”?

在多模态大模型(MLLM / VLM)爆发的初期,多数模型(如早期 LLaVA、BLIP-2)均采用单体式(Monolithic)架构:输入一张图像与文本问题,模型直接输出最终答案。这种”一步到位”的映射在简单的图像描述或常见物体识别上表现优异,但在面对细粒度对比、多跳空间推理、几何推导或长文档图表分析时,表现出极高的错误率。

其根本原因在于:

  1. 语言偏置与视觉幻觉(Language Bias & Hallucination):模型极易根据语言模型的先验知识”瞎猜”答案,而非基于图像细节。
  2. 缺乏空间与感知注意力更新:传统的单次视觉特征抽取(Global Visual Embedding)忽略了人类在处理复杂视觉问题时”扫描-聚焦-反复确认”的认知过程。

为了打破这一瓶颈,研究者将 LLM 的思维链理念拓展至视觉领域,催生了 Visual CoT(视觉思维链)


一、视觉 CoT 的早期探索:语言中心的”文本演绎”(2023)

在 Visual CoT 的雏形阶段,研究者主要致力于将文本 CoT 范式移植到多模态输入中

代表性工作:Multimodal-CoT (ScienceQA)

  • 文献Multimodal Chain-of-Thought Reasoning in Language Models (Zhang et al., OpenReview 2023 / Amazon)
  • 核心机制:提出了一种两阶段(Two-stage)解耦框架:
    1. 第一阶段(Rationale Generation):融合文本与视觉特征,先生成一段包含推理逻辑的文本依据(Rationale)。
    2. 第二阶段(Answer Inference):将问题与第一阶段生成的 Rationale 拼接,输入模型推导最终答案。
  • 里程碑意义:证明了在小参数量模型(<1B)中,显式生成中间推理能够显著提升 ScienceQA 等基准的表现。

深度评述与局限性

早期的 Multimodal CoT 本质上依然是”语言中心(Language-Centric)”的。图像被作为静态特征一次性喂给模型,模型生成的 CoT 仅仅是文本层面的逻辑推导。这种方式存在致命缺陷:模型生成的”思考步骤”与真实的”视觉感知”缺乏显式绑定。模型可能会生成看起来非常合理的文本推理,但其依据的图像区域其实完全看错了(即”伪推理”)。


二、显式定位与结构化分解:从”只说不看”到”边说边指”(2024)

为了解决文本 CoT 与视觉证据脱节的问题,研究界掀起了一场以组合式视觉推理(Compositional Visual Reasoning, CVR)为核心的范式变革,强调思考过程必须进行视觉定位(Visual Grounding)

范式演进示意

[传统单体模型] 图像 + 问题 ——————————> 直接输出答案 (易幻觉) [早期文本 CoT] 图像 + 问题 -> 生成文本推理逻辑 ——> 输出答案 (视觉脱节) [显式 Visual CoT] 图像 + 问题 -> [文本逻辑 + Bounding Box/RoI] -> 动态聚焦局部 -> 输出答案 (可解释/精准)

1. 结构化阶段演进与框架梳理

在综述 Explain Before You Answer: A Survey on Compositional Visual Reasoning (Ke et al., arXiv 2025) 中,研究者将这种范式划分为明确的递进阶段:

  • Stage I & II(工具增强与管道分解):利用 LLM 规划步骤,调用外部视觉专家模型(如 Segment Anything, Grounding DINO)获取局部裁剪图或检测框,再汇总决策。
  • Stage III & IV(原生内置 CoT 与结构化推理):模型在一个前向传播中同时输出文本逻辑与空间坐标([x, y, w, h])。

2. 标志性数据集与模型架构

  • Visual CoT Dataset & BenchmarkVisual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning (Shao et al., NeurIPS 2024 Track)
    • 贡献:构建了包含 438k 问答对的大型数据集,显式标注了推导中间步骤所对应的关键边界框(Bounding Boxes)。通过多轮处理管道,促使模型在思考过程中动态聚焦(Dynamic Focus)于图像的关键局部区域。
  • LLaVA-CoTLLaVA-CoT: Let Vision Language Models Reason Step-by-Step (2024 / ICCV 2025)
    • 贡献:将多模态推理显式拆解为四个阶段——摘要阶段(Summary)→ 描述阶段(Caption)→ 逻辑推理阶段(Reasoning)→ 结论阶段(Conclusion),并首次展示了多模态推理的”推理时可扩展性(Inference-time Scaling Laws)”。

深度评述

这一阶段的 Visual CoT 成功实现了”思考可追溯(Auditability)”。当模型出错时,开发者可以清楚查看模型是在哪一步的 Bounding Box 定位上出现了偏差。然而,基于 Supervised Fine-Tuning (SFT) 的高质量 Bounding Box / RoI 标注极其昂贵,难以覆盖真实世界无限的视觉组合场景。


三、强化学习驱动与”慢感知”时代:视觉 o1 与动态交互(2024–2026)

受 OpenAI o1 和 DeepSeek-R1 在纯文本领域通过强化学习(RL)激发长链思考(Long-form Thinking)的启发,Visual CoT 在 2024–2026 年迎来了跨越式突破:从”被动生成文本+坐标”转变为”RL 驱动的主动感知与空间探索”

在宏观综述 Reasoning in Computer Vision: Taxonomy, Models, Tasks, and Methodologies (Sarkar et al., arXiv 2025) 中,这一阶段被归纳为视觉系统从”图像模式匹配”向”因果、空间与多步骤认知”的跃迁。

1. 空间坐标与 RL 奖励(Grounded RL & Spatial CoT)

代表工作如 ViGoRL (Grounded Reinforcement Learning for Visual Reasoning, 2025) 与 GRIT (Teaching MLLMs to Think with Images, 2025):

  • 机制:放弃了昂贵的密集人工 CoT 标注,改用 GRPO(Group Relative Policy Optimization) 等基于规则/答案正确性的强化学习。
  • 突破:在奖励函数中结合”最终答案准确率”与”格式约束”,鼓励模型在 <thought> 链中自主交织输出文本与空间坐标 (x, y)。模型在 RL 的驱动下,自发涌现出了自顶向下的区域扫描、空间对比与自我校验(Self-Correction)行为

2. 从”慢思考”到”慢感知”(Slow Perception & Active Zoom)

传统的视觉模型倾向于单次快速感知整个图像,但在处理极细小的物体、复杂的电路图或几何图形时,这种”快感知”必然失效。

  • Slow Perception(慢感知)Slow Perception: Let’s Perceive Geometric Figures Step-by-step (2024)
    • 理念:提出感知本身不是瞬时的。论文将视觉感知分解为”Perception Decomposition(感知单元拆解)”和”Perception Flow(感知流)”,引导模型像人类画图/扫描一样,沿着点、线、面逐笔(Stroke-by-stroke)解读图像。试验表明,感知变慢后,推理性能享受到了显著的 Inference-time Scaling 特性
  • 动态工具交互(Dynamic Crop / Zoom Tool Calling)
    • 在 ViGoRL 及 VisReason 等最新框架中,Visual CoT 允许模型在 Reasoning Chain 中触发工具命令,如 {"name": "crop", "box": [...]}。环境会返回放大后的高清局部图作为新的 Visual Feedback。这标志着模型具备了根据当前思考状态主动获取高分辨率视觉信息的能力。

四、关键批判与未来挑战(Critical Review)

尽管 Visual CoT 取得了瞩目的进展,但站在当前技术节点,我们仍需清醒地认识到其面临的底层难题:

1. “Overthinking(过度思考)”与感知噪音

在简单的视觉识别任务(如”图中是否有猫”)中,强行引入多轮 Visual CoT 或动态 Zoom 会导致严重的推理延迟与计算资源浪费。此外,某些模型在长链推理中会陷入死循环或在局部细节中”迷失”,产生视觉注意力过度分散引起的错误决策。Vision-R1 (2025) 等工作提出的渐进式思考抑制(Progressive Thinking Suppression)正在尝试缓解这一问题,但如何自适应决定何时启动 Visual CoT 依然是开放课题。

2. 视觉 Token 的上下文瓶颈(Context Bottleneck)

多轮 Zoom/Crop 和频繁的视觉锚定会在 Context Window 中引入大量的高维视觉 Token。高分辨率视觉特征与长文本思考链叠加,导致 KV Cache 呈指数级增长。如何实现高效的视觉 Token 压缩与选择性记忆(Selective Perception)是工程落地的关键瓶颈。

3. 从 2D 静态平面到 3D 具身/物理世界

当前的 Visual CoT 绝大多数局限于 2D 静态图像或图表。然而真实世界的物理推理(如”这个杯子放上去会不会倒”、”机器人如何避开障碍物”)需要深度感知、3D 空间关系以及时间轴上的动态预测。将 Spatial CoT 拓展至 3D 几何与视频时序推理(Video CoT / Embodied CoT)是下一个不可避免的战场。


总结

Visual CoT 的演化脉络可以清晰地概括为三个阶段:

时代 核心范式 关键特征
1.0(2023) 文本中心化的离散推理 实现简单的”事后解释”
2.0(2024) 显式 Grounding + 结构化 Stage 实现”空间证据锚定”
3.0(2025–2026) RL 驱动 + 慢感知 + 动态交互 主动的”慢思考 Agent”

Visual CoT 不仅是一项 Prompting 技巧或数据集构建技术,更是多模态大模型从“模式识别器(Pattern Matcher)”迈向“真实世界认知体(Cognitive Engine)”的必由之路。


参考文献与拓展阅读

  1. Multimodal-CoT: Multimodal Chain-of-Thought Reasoning in Language Models (Zhang et al., 2023)
  2. LLaVA-CoT: LLaVA-CoT: Let Vision Language Models Reason Step-by-Step (PKU-Yuan Group, ICCV 2025)
  3. Slow Perception: Slow Perception: Let’s Perceive Geometric Figures Step-by-Step (2024)
  4. Grounded RL: ViGoRL: Grounded Reinforcement Learning for Visual Reasoning (2025)

```bibtex @article{Sarkar2025ReasoningIC, title={Reasoning in Computer Vision: Taxonomy, Models, Tasks, and Methodologies}, author={Ayushman Sarkar and Mohd. Yamani Idna Idris and Zhenyu Yu}, journal={ArXiv}, year={2025}, volume={abs/2508.10523}, url={https://api.semanticscholar.org/CorpusID:280649756} }

@article{Ke2025ExplainBY, title={Explain Before You Answer: A Survey on Compositional Visual Reasoning}, author={Fucai Ke and Joy Hsu and Zhixi Cai and Zixian Ma and Xin Zheng and Xindi Wu and Sukai Huang and Weiqing Wang and Pari Delir Haghighi and Gholamreza Haffari and Ranjay Krishna and Jiajun Wu and Hamid Rezatofighi}, journal={ArXiv}, year={2025}, volume={abs/2508.17298}, url={https://api.semanticscholar.org/CorpusID:280711346} }