李沅泽

李沅泽 · 学术著作

论文与著作

李沅泽目前的公开论文围绕同一个问题:让多模态大模型在真实、信息密集的 文档上完成专业级推理。在学术场景里,这是看懂论文实验图(SPUR)、 并判断其中图像是否造假(THEMIS、AEGIS);在金融场景里, 则是结合情景假设与长篇报告完成多步数值推理(FinMMDocR)。

  1. THEMIS: Towards Holistic Evaluation of MLLMs for Scientific Paper Fraud Forensics 论文首页
    ICLR 20262026

    THEMIS: Towards Holistic Evaluation of MLLMs for Scientific Paper Fraud Forensics

    科学论文图像造假取证:对多模态大模型的一次系统性考试

    论文造假不只发生在文字里,也常常藏在被修改过的图表、显微照片和实验图像中。THEMIS 构建了一个评测多模态大模型“视觉取证”能力的基准:数据来自真实撤稿案例与精心构造的多模态合成样本,共 4000 余道题、覆盖 7 类真实学术场景;把常见造假归纳为 5 类手法、16 种细粒度操作,并进一步映射到 5 项核心视觉推理能力,从而看出不同模型各自的强项与短板。作者在 16 个主流多模态大模型上做了测试,表现最好的 GPT-5 也只有 56.15% 的整体准确率——说明复杂、真实场景下的论文图像取证,对当前模型仍然是很苛刻的任务。

  2. FinMMDocR: Benchmarking Financial Multimodal Reasoning with Scenario Awareness, Document Understanding, and Multi-Step Computation 论文首页
    ACL 20262026

    FinMMDocR: Benchmarking Financial Multimodal Reasoning with Scenario Awareness, Document Understanding, and Multi-Step Computation

    金融多模态推理:情景意识、文档理解与多步计算

    真实金融题和考试题最大的区别是:条件不会自己列好,数字散落在几十页的报告里,结论还要靠一串计算推出来。FinMMDocR 构造了 1,200 道中英双语的金融数值推理题,全部经过专家标注:57.9% 的题目包含 12 类隐含金融情景(如投资组合管理),要求模型先根据情景作出专业假设;837 份中英文金融文档覆盖 9 类材料,平均长达 50.8 页;每题平均需要 11 步推理(5.3 步抽取 + 5.7 步计算),其中 65% 的题必须跨页寻找证据。作者评测了主流多模态大模型,表现最好的也只达到 58.0% 准确率,且不同检索增强(RAG)方案的结果差异很大——说明复杂金融文档推理仍是明显短板。

  3. Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and Reasoning 论文首页
    ACL 20262026

    Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and Reasoning

    读懂科研实验图:感知、理解与推理的 SPUR 基准

    论文里的实验图通常由许多子图拼成,想真正读懂它,需要先看清每个 panel 的细节,再理解多个 panel 之间的关系,最后像领域专家一样从证据推出结论。SPUR 从专家筛选的 1,084 张实验图像出发,构造了 4,264 道问答题目(平均每张图含 14.3 个 panel),分别评测模型在数值、形态和信息定位三个维度上的细粒度感知、跨 panel 关系理解,以及五种实验范式下的专家级推理。作者评测了 20 个多模态大模型和 4 种多模态思维链(MCoT)方法,发现当前模型离“像专家一样读图”还有明显差距,并把这一点称为 AI for Science 研究中的关键瓶颈。

  4. AEGIS: A Holistic Benchmark for Evaluating Forensic Analysis of AI-Generated Academic Images 论文首页
    ACL 20262026

    AEGIS: A Holistic Benchmark for Evaluating Forensic Analysis of AI-Generated Academic Images

    AI 生成的论文配图,模型还能验出真假吗

    生成模型让“做一张以假乱真的论文配图”变得很容易,也让审稿人和读者更难以判断一张图是否可信。AEGIS 是专门面向 AI 生成学术图像取证的整体评测基准:覆盖 7 类学术图像、39 个细分子类,模拟 4 类常见伪造策略并用 25 个生成模型实例化,构造超过 2 万道取证题目。评测不只看“能不能判断真假”,还同时考察检测、推理与篡改区域定位。结果显示多模态大模型在识别文字伪影上较强(84.74% 准确率),专用检测器在二分类真伪判断上更准(79.54%),但最强的 GPT-5.1 整体也只有 48.80%,定位 IoU 仅 30.09%——学术图像取证整体仍落后于图像生成技术的发展。

论文信息整理自 arXiv 与 ACL / ICLR 官方页面;如需引用,请以原文为准。