首个长推理链多模态智能体检索评测基准当前多模态RAG评测基准普遍局限于1–2跳短检索、固定“检索-生成”范式缺乏长推理链、分步标注与结构化推理拓扑无法精准评估多模态智能体的自适应规划与跨模态推理能力本文首创MC-SEARCH基准构建覆盖5类结构化长推理链的多模态智能体RAG评测集通过HAVE逐跳证据校验保证样本质量并提出过程级评测指标同时推出SEARCH-ALIGN过程监督微调框架用验证后的推理链强化开源模型的规划与检索保真度最终形成3,333个高质量样本平均3.79跳开源模型经微调后F1最高提升13.7、逐步检索命中率提升16.0有效解决过检索、欠检索与模态规划错位问题。 论文基本信息项目内容论文标题MC-SEARCH: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains核心贡献MC-SEARCH基准、HAVE质量校验、过程级评测指标、SEARCH-ALIGN微调框架作者/机构Xuying Ning等伊利诺伊大学厄巴纳-香槟分校、Meta、IBM Research、石溪大学发表年份/会议2026ICLR核心领域多模态大模型、智能体式RAG、多跳检索、长推理链评测关键数据/规模总样本3,333平均推理跳数3.79知识库含389,750张图像、784,473篇文档代码/资源开源已开源数据集与代码https://mc-search-project.github.io 研究背景与痛点1. 短链与固定范式瓶颈Short Chain Fixed Paradigm Bottleneck现象现有多模态RAG基准仅支持1–2跳检索采用固定“检索-生成”流程无自适应规划能力。后果无法评估复杂跨模态多跳推理模型易走捷径、产生幻觉真实能力被高估。本质评测集与真实场景的长推理、多模态、智能体化需求严重脱节。2. 无分步标注与结构缺失No Step-wise Annotation Structure Loss现象仅提供最终问答对无逐步子问题、检索模态、中间证据与答案标注。后果无法定位错误来源规划/检索/推理无法做过程级优化与监督。本质缺乏对推理过程的细粒度刻画仅关注结果忽略路径。3. 现有解决方案的局限传统VQA/RAG基准仅单跳/双跳、无模态规划、无长链验证。文本智能体基准仅文本模态不支持跨图像-文本协同推理。过程监督方法无统一的多模态长链高质量标注数据支撑。4. MC-SEARCH 的核心洞察多模态智能体RAG需5类结构化推理拓扑覆盖串行/并行、图文发起场景。数据集质量需逐跳必要性校验剔除幻觉与冗余步骤。评测需答案过程双维度精准诊断规划、检索、推理缺陷。开源模型短板在模态规划与检索执行可通过过程监督显著提升。️ 核心方法MC-SEARCH 全景详解MC-SEARCH以结构化长推理链为核心完成“数据集构建→质量校验→过程评测→模型增强”全链路是首个面向多模态智能体RAG的端到端基准与优化框架。1. 五大推理拓扑设计 —— “推理路径导航图”设计目标全覆盖真实多模态智能体检索的串行/并行、图文发起逻辑形成完备拓扑基。详细执行流程图像发起链首步图像检索后续文本检索占比最多1,306条。文本发起链首步文本检索末步图像验证169条。纯文本链全流程文本检索作为基线945条。图文并行分支图像/文本检索并行无依赖需跨模态协同680条。多图像分支多图对比检索再文本补全事实233条。关键逻辑/机制 核心逻辑以发起模态结构类型为维度穷尽多模态智能体RAG的 canonical 推理结构无冗余、无遗漏。推理拓扑形式化定义G(Q,A){(qt,mt,rt,at)}t1T, rtR(qt,mt), Af({at}t1T) \mathcal{G}(Q,A)\left\{\left(q_{t}, m_{t}, r_{t}, a_{t}\right)\right\}_{t1}^{T},\; r_{t}\mathcal{R}\left(q_{t}, m_{t}\right),\; Af\left(\left\{a_{t}\right\}_{t1}^{T}\right)G(Q,A){(qt​,mt​,rt​,at​)}t1T​,rt​R(qt​,mt​),Af({at​}t1T​)类比解释像导航软件预设5种典型路线先步行后开车、全程开车、步行/开车并行、多段步行、先开车后步行覆盖所有出行逻辑。2. HAVE逐跳证据校验 —— “推理链安检系统”设计目标剔除幻觉步骤、冗余步骤保证每一跳必要且有效。详细执行流程上下文效用Util(t)Util(t)Util(t)移除第ttt步证据后答案F1下降值判断对结果的贡献。Util(t)F1(C)−F1(C∖rt)Util(t)F1(\mathcal {C})-F1(\mathcal {C}\setminus r_{t})Util(t)F1(C)−F1(C∖rt​)导航效用Nav(t)Nav(t)Nav(t)判断当前步实体是否出现在后续子问题判断对推理路径的连接作用。Nav(t){1,Ent(at)∩Ent(qt1:T)≠∅0,otherwise Nav(t) \begin{cases}1, Ent(a_t)∩Ent(q_{t1:T})≠∅ \\ 0, otherwise\end{cases}Nav(t){1,0,​Ent(at​)∩Ent(qt1:T​)∅otherwise​过滤规则Util(t)Util(t)Util(t)不达标且Nav(t)0Nav(t)0Nav(t)0→ 标记为冗余剔除该样本。多级校验Qwen2.5-VL-7B粗滤→Gemini-2.5-Pro精修→Gemini-2.5-Flash终检得到3,333条高质量样本。关键逻辑/机制 核心逻辑以结果贡献路径连接双维度逐跳把关只保留“非它不可”的推理步骤。类比解释像海关安检既查行李对行程的实际用处效用又查是否是必经关卡导航无效行李直接拒收。3. 过程级评测协议 —— “推理全程打分表”设计目标超越答案精度实现规划、检索、推理全流程量化评估。详细执行流程答案精度F1、ΔF1ΔF1ΔF1检索增益、Golden F1上限、LLM-as-Judge。逐步检索命中率HPSHPSHPS预测步骤与黄金证据匹配的比例。HPS(G^,G)1∣G∣∣{(t,t′)∣rt∈G,r^t′∈G^,r^t′rt}∣ HPS(\hat{\mathcal{G}},\mathcal{G})\frac{1}{|\mathcal{G}|}\left|\left\{(t,t)\mid r_t∈\mathcal{G},\hat{r}_{t}∈\hat{\mathcal{G}},\hat{r}_{t}r_t\right\}\right|HPS(G^​,G)∣G∣1​​{(t,t′)∣rt​∈G,r^t′​∈G^​,r^t′​rt​}​展开偏差RDRDRD预测链长与黄金链长的绝对差衡量过/欠检索。RD(G,G^)∣∣G^∣−∣G∣∣ RD(\mathcal {G},\hat{\mathcal{G}})||\hat {\mathcal{G}}|-|\mathcal{G}||RD(G,G^​)∣∣G^​∣−∣G∣∣关键逻辑/机制 核心逻辑用逐步匹配长度偏差精准诊断“多查了、少查了、查错模态”。类比解释像考试不只看总分还批改每一步解题步骤判分更公平、定位更精准。4. 智能体MM-RAG流水线 —— “跨模态检索助手”设计目标统一评测框架保证不同模型公平对比。详细执行流程子问题动作生成分解问题选择检索动作文本搜/文本搜图/以图搜图。证据获取多模态编码器稠密检索取top1证据。迭代推理合成整合证据判断继续检索或输出最终答案。关键逻辑/机制 核心逻辑迭代式“规划-检索-推理”暴露完整推理轨迹支持过程评测。类比解释像侦探破案先提小问题→找线索→整合线索→再提新问题直到破案。5. SEARCH-ALIGN过程对齐 —— “推理教练”设计目标用黄金推理链做过程监督提升开源模型的规划与检索能力。详细执行流程训练数据构造为黄金推理链补充思考过程转为对话轨迹。过程监督微调不只监督最终答案同时监督子问题、检索模态、中间答案。适配模型InternVL3.5-8B、Qwen2.5-VL-7B。关键逻辑/机制 核心逻辑从“只教答案”升级为“教解题步骤检索方法”根治规划与检索缺陷。类比解释像老师不只改作业答案还手把手教解题步骤、查资料方法学生举一反三。 实验结果与深度分析1. 核心性能对比闭源模型Gemini-2.5-Pro整体最优长链鲁棒性最强。开源模型InternVL3.5-8B基线更强Qwen2.5-VL-7B提升空间极大。SEARCH-ALIGN增益InternVLF12.8、HPS12.0、RD-0.6Qwen2.5-VL-7BF113.7、HPS16.0、RD-3.1拓扑难度图文并行分支 多图像分支 图像发起 文本发起/纯文本。2. 关键发现与洞察发现一链长越长性能暴跌深度解读1–3跳性能稳定≥4跳误差累积所有模型均大幅下降长链推理是核心瓶颈。发现二过/欠检索均有害适度多查有益深度解读严重欠检索→信息缺失过度检索→噪声干扰多1–2步可弥补规划缺陷。发现三模态严重偏好文本图像依赖显式提示深度解读文本覆盖率78%无图像提示时模型图像检索覆盖率骤降模态对齐能力极差。发现四三大核心错误深度解读检索失败(84.7%)、幻觉实体(75.8%)、步骤遗漏(74.3%)问题集中在规划与检索而非证据理解。 主要创新点总结首创长链多模态智能体RAG基准覆盖5类结构化推理拓扑平均3.79跳首个支持长跨模态推理评测。HAVE逐跳质量校验双维度效用过滤保证样本无幻觉、无冗余质量评分达4.87/5。过程级评测指标体系HPSRD实现逐步检索与规划量化超越传统答案精度。SEARCH-ALIGN过程监督用黄金推理链微调大幅提升开源模型模态规划与检索保真度。⚠️ 局限性与挑战样本分布不均文本发起、多图像分支样本量偏少拓扑覆盖不均衡。领域单一基于维基百科未覆盖科学、医疗、工业等垂直领域。检索限制实验仅用top1检索未验证top-k场景的泛化性。闭源模型未微调仅对开源模型做SEARCH-ALIGN闭源模型潜力未挖掘。仅英文数据无多语言支持适用范围受限。 对开发者的实战建议如果你正在构建多模态智能体RAG系统用MC-SEARCH做基准测试快速定位模型在长链、跨模态、并行推理的短板。复用HAVE做数据过滤自建多跳数据集时用逐跳效用导航校验剔除低质量样本。采用SEARCH-ALIGN微调开源模型优先优化模态规划与检索执行而非仅提升感知能力。控制检索步数避免严重过/欠检索设置黄金步长±1的动态停止策略。强化模态触发机制在Prompt中显式引导图像检索弥补模型文本偏好缺陷。一句话总结MC-SEARCH首次把多模态智能体RAG的评测从“结果导向”升级为“过程导向”用高质量长推理链数据与过程监督真正解锁多模态长链推理能力。