声明本文是对论文ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning的中文解读仅供学习交流使用。版权归原作者所有翻译如有疏漏以原文为准。原文链接[2512.00305] ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning收录会议ICCV 2025一、论文信息项目内容中文标题ChartPoint用定位反射指导多模态大语言模型进行图表推理英文标题ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning作者Zhengzhuo Xu, SiNan Du, Yiyan Qi, Siwen Lu, Chengjin Xu, Chun Yuan, Jian Guo机构清华大学、国际数字经济学院、北京航空航天大学、香港科技大学广州arXivarXiv:2512.00305会议ICCV 2025二、一句话概括以前的模型是“闭着眼”根据 OCR 文字猜数字这篇论文让模型“睁着眼”指着图表上的位置算数字并且画完框后还要再看一眼再继续算。三、背景痛点多模态大语言模型在处理图表时严重依赖 OCR 提取的文字。当图表上的柱子、折线没有直接标注具体数值时模型就开始产生数值幻觉——给出看似合理但实际错误的数字。现有方法增加指令数据、提高分辨率、改进对齐训练都治标不治本。根本原因在于模型的推理过程与视觉感知是脱节的——它虽然在“想”但并没有真正在“看”。作者做了一个关键实验让模型在推理时同时输出每一步对应的图表位置用边界框表示。结果模型要么忽略这个要求要么乱指一通。这说明思维链只是增加了推理长度但并未让模型真正与视觉编码器形成有效互动。四、创新点PointCoT用一句话说清楚创新点在思维链的每一步中强制模型输出边界框BBox并重渲染图表形成视觉反馈。4.1 方法概述【原文翻译】研究者通过在 CoT 中加入反射式交互过程来增强它让模型输出边界框并与重渲染的图表互动称为 PointCoT。该方法通过结构化的推理过程增强模型的推理链并引入了一条自动化标注流水线。流水线包含四个阶段步骤分解用 LLM 根据绘图代码生成问答对和推理步骤将每步标记为 Grounding定位或 Reasoning推理代码编辑修改原始代码在 Grounding 步骤对应位置插入特殊符号如代码渲染执行修改后的代码生成带符号的新图表位置定位用 OCR 识别符号位置自动获得边界框坐标【解读】这不是简单的“改提示词”——而是在训练环节把“画框”能力植入模型。训练环节核心构建包含 6.2 万条“带边界框标准答案”的数据集通过监督微调把“看图→定位→推理”的能力写入模型权重推理环节辅助测试时用专门的提示词要求模型输出边界框。但图 6 显示不经过微调的 GPT-4o 和原版 Qwen2.5-VL 根本不理睬这个要求只有经过微调的 ChartPoint 才会乖乖听话自动化标注流水线的巧妙之处不需要人工标注位置而是利用生成图表的“源代码”——在代码里埋个渲染后用 OCR 反向提取坐标位置就是标准答案。五、核心数学公式5.1 坐标归一化表 7论文比较了三种 BBox 坐标表示法类型 A归一化到 [0,1]保留 4 位小数 → 提升 0.52%类型 B归一化到 [0,1]保留 3 位小数 → 提升 1.26%类型 C最优0–999 整数 → 提升 1.68%原因Qwen 的令牌化器将小数按三位分段如 “0.1234” → “0” 、 “.” 、 “123” 、 “4”增加训练难度。0–999 整数与基座预训练坐标格式一致效果最佳。5.2 边界框表示5.3 宽松准确率设预测值为 p真实值为 g其中 ττ 取 0.05、0.10、0.20。允许数值估计的微小偏差例如视觉上估计柱高为 3.1 而真实值为 3.0 也算对适合评估视觉估计任务。六、实验结论6.1 主实验结果基准基座模型ChartPoint提升ChartQA含文字标注Qwen2-VL 83.16%85.28%2.12%ChartQAQwen2.5-VL 86.36%87.74%1.38%ChartBench无文字标注Qwen2-VL 58.90%62.61%3.71%ChartBenchQwen2.5-VL 60.91%65.95%5.04%解读ChartBench 无数据点标注更考验视觉估计能力因此 PointCoT 的优势被充分放大。在额外类型图表上提升高达 7.77%说明学到的不是过拟合而是泛化的定位-推理能力。6.2 消融实验训练设置ChartBench 提升仅第一阶段对齐0.58% 纯文本 CoT0.76% PointCoT3.71%解读纯文本 CoT 几乎没用关键变量是定位监督——边界框的引入。图表理解瓶颈是视觉定位能力而非推理能力。6.3 基座模型依赖定位能力弱的模型Qwen-VL v1、ChartMoE上 PointCoT 提升 0.5%定位能力强的模型Qwen2-VL、Qwen2.5-VL上提升 1%结论PointCoT 是“锦上添花”需要基座模型本身具备定位能力。6.4 案例可视化图 6对比 GPT-4o、Qwen2.5-VL-72B 和 ChartPointQ2.5要求同时输出推理和边界框。只有 ChartPoint 按要求输出边界框提取的数值更精确。结论“推理时定位”不是大模型的天然能力需要专门训练。七、总结核心贡献维度内容方法创新将视觉定位从辅助能力提升为推理过程的核心组成部分工程创新利用“代码-图像”配对实现自动化边界框标注无需人工性能提升ChartBench 上 5.04%尤其擅长无文字标注图表可解释性模型输出边界框作为推理证据用户可验证其关注区域局限性依赖基座模型固有定位能力需 Qwen2-VL 及以上坐标表示格式需与基座令牌化器适配启示推理必须可验证用户应能看到模型依据的视觉区域自动化数据构建范式可推广到其他有“代码-渲染”配对的领域思路可迁移文档理解、场景理解等需要精确定位的任务