2026年10月2日 · science · 17分钟阅读

FunBench:多模态大模型眼底图像解读能力基准——论文阅读笔记

AI 翻译说明: 本文由 OpenAI Codex(GPT-5-Codex)根据英文原文翻译,并保留原文的结构、论点、公式与参考文献。

摘要

FunBench 是一个新颖的分层数据集与基准,用于评估开源多模态大语言模型(MLLM)在不同难度眼底图像解读任务上的有效性。代码与数据已发布在 GitHub 和 Hugging Face。1

FunBench 概览

1. 为什么这篇论文值得关注

这篇论文为评估 MLLM 的眼底图像解读能力提供了一个合理的基准。它既可直接用于评价眼科 MLLM 或智能体工作流的表现,也为其他领域开发 MLLM 基准提供了一套方法与思路。1

2. 背景与动机

2.1 背景与问题

尽管医学 MLLM 研究正在快速增长,但面向眼科学的基准开发仍然相对滞后。1

2.2 既有工作的空缺

OmniMedVQA、GMAI-MMBench 等既有医学基准在更广泛的医学评估中纳入了视网膜图像,但它们没有提供 FunBench 所提出的特定眼科学任务层级,以及针对模型模块的组合式评估。GMAI-MMBench 本身也包含多项任务和不同感知粒度,因此不应被描述为一个缺乏结构的单任务基准。1 4 5

在与 LMOD 的比较中,FunBench 重点强调眼底图像中主要解剖结构及两种疾病的识别。这并不能完整概括 LMOD,因为 LMOD 还覆盖多模态信息和亚组分析。1 6

3. 核心贡献

  • 设计了分层任务体系,范围从低层次的成像模态与解剖感知,到高层次的病变分析和疾病诊断。
  • 针对 MLLM 的两个关键模块——视觉编码器(VE)和大语言模型(LLM)——提供代理评估,并同时进行整体评估。这些模式提供了互补视角,但无法完全隔离各模块的贡献。1

4. 方法

4.1 概览

FunBench 将眼底图像解读组织为四个层级,并通过三种针对性评估模式评价 MLLM。1

4.2 数据集构建

4.2.1 分层任务组织

层级 1(L1):成像模态感知

  • L1a:粗粒度成像模态感知

    请根据图像与问题选择最合适的选项,并直接回答选项字母。
    问题: 这里呈现的是什么类型的图像?
    选项: A. 眼底图像;B. 遥感图像;C. 绘画;D. 全切片图像。

  • L1b:细粒度成像模态感知

    请根据图像与问题选择最合适的选项,并直接回答选项字母。
    问题: 这幅图像采用了哪种成像技术?
    选项: A. 超广角眼底摄影;B. 超声;C. 眼底荧光血管造影;D. X 射线。

层级 2(L2):解剖感知

  • L2a:判断视盘与中央凹的相对位置

    请根据图像与问题选择最合适的选项,并直接回答选项字母。
    问题: 视盘和中央凹中,哪一个位于左侧?
    选项: A. 视盘;B. 中央凹。

  • L2b:识别眼底图像的左右眼别

    请根据图像与问题选择最合适的选项,并直接回答选项字母。
    问题: 这幅图像显示的是左眼还是右眼?
    选项: A. 左眼;B. 右眼。

层级 3(L3):病变分析

  • L3a:病变识别

    请根据图像与问题选择最合适的选项,并直接回答选项字母。
    问题: 这幅眼底图像是否显示纤维增殖的证据?
    选项: A. 否;B. 是。

  • L3b:病变定位

    请根据图像与问题选择所有合适的选项;如有必要,请用逗号分隔选项字母并直接作答。
    问题: 这幅眼底图像中的纤维增殖位于哪里?
    选项: A. 视盘中心颞侧;B. 视盘中心鼻侧;C. 图像中未见;D. 视盘中心下方;E. 视盘中心上方。

  • L3c:病变大小估计

    请根据图像与问题选择最合适的选项,并直接回答选项字母。
    问题: 眼底照片中纤维增殖的面积是多少?
    选项: A. 图像中未见;B. 不超过 0.5 个视盘面积;C. 0.5 至 1.0 个视盘面积;D. 1.0 至 1.5 个视盘面积;E. 1.5 至 2.0 个视盘面积;F. 超过 2.0 个视盘面积。

  • L3d:病变计数

    请根据图像与问题选择最合适的选项,并直接回答选项字母。
    问题: 图像中可以看到多少处出血?
    选项: A. 图像中未见;B. 不超过 5 处;C. 5 至 15 处;D. 15 至 25 处;E. 25 至 35 处;F. 超过 35 处。

层级 4(L4):疾病诊断

  • L4a:二分类疾病诊断

    请根据图像与问题选择最合适的选项,并直接回答选项字母。
    问题: 这幅眼底图像是否显示任何疾病征象?
    选项: A. 是;B. 否。

  • L4b:多疾病诊断

    请根据图像与问题选择所有合适的选项;如有必要,请用逗号分隔选项字母并直接作答。
    问题: 这幅眼底图像显示了哪些具体异常?
    选项: A. 无异常;B. 视网膜色素变性;C. 视网膜静脉阻塞;D. 视网膜动脉阻塞;E. 糖尿病视网膜病变。

  • L4c:糖尿病视网膜病变分级

    请根据图像与问题选择最合适的选项,并直接回答选项字母。
    问题: 给定眼底图像显示的是哪一期糖尿病视网膜病变?
    选项: A. 增殖期糖尿病视网膜病变;B. 轻度非增殖期糖尿病视网膜病变;C. 重度非增殖期糖尿病视网膜病变;D. 无糖尿病视网膜病变;E. 中度非增殖期糖尿病视网膜病变。

  • L4d:年龄相关性黄斑变性分类

    请根据图像与问题选择最合适的选项,并直接回答选项字母。
    问题: 所示眼底图像属于哪一类年龄相关性黄斑变性?
    选项: A. 早期年龄相关性黄斑变性;B. 中期年龄相关性黄斑变性;C. 无年龄相关性黄斑变性;D. 晚期年龄相关性黄斑变性。

准确的已发布任务定义可在 FunBench 数据集中查看。3

4.2.2 数据来源

FunBench 改编自以下 14 个公开数据集:1

  • 六个 CFP 数据集: IDRiD、DDR、JSIEC、RFMiD、OIA-ODIR、Retinal-Lesions
  • 五个 OCT 数据集: OCTDL、NEH、OCTID、UCSD、RETOUCH
  • 一个 UWF 数据集: TOP
  • 两个多模态数据集: MMC-AMD(CFP + OCT)和 DeepDRiD(CFP + UWF)

表 1. FunBench 统计信息:报告的任务层级包含 16,348 幅眼底图像和 91,810 个视觉问题。 各行与任务标识符共列出 2 + 2 + 4 + 4 = 12 项任务,而原论文表 1 的标题报告为 10 项任务。1(表 1)

层级单选问题多选问题示例问题数据来源
L1
任务:2
32,6960这幅图像采用什么方法采集?
A. 磁共振成像
B. 超广角眼底摄影
C. 彩色眼底摄影
D. 光学相干断层扫描
所有数据集
L2
任务:2
10,9800这幅图像显示的是左眼还是右眼?
A. 右眼
B. 左眼
CFP: DDR、DeepDRiD、IDRiD、OIA-ODIR、Retinal-Lesions
UWF: TOP
CFP + UWF: DeepDRiD
L3
任务:4
子任务:39
15,6067,237眼底图像中的出血位于哪些位置?
A. 视盘中心鼻侧
B. 视盘中心颞侧
C. 视盘中心上方
D. 视盘中心下方
E. 图像中未见
CFP: DDR、IDRiD、Retinal-Lesions
OCT: RETOUCH
L4
任务:4
20,1775,114这幅眼底图像中可见哪些异常?
A. 青光眼
B. 糖尿病视网膜病变
C. 无异常
D. 年龄相关性黄斑变性
E. 高血压性视网膜病变
CFP: DDR、IDRiD、OIA-ODIR、JSIEC、RFMiD、Retinal-Lesions
OCT: NEH、OCTDL、OCTID、UCSD
UWF: TOP
CFP + OCT: MMC-AMD
CFP + UWF: DeepDRiD

4.3 针对性评估模式

为评估 MLLM 及其两个关键模块——LLM 与 VE——作者以自底向上的方式提出了三种针对性评估模式(E-mode)。1(图 1)

E-mode I:基于线性探测的 VE 评估

如图 1b 所示,线性探测利用特定任务的开发集,为每个任务或子任务训练一个线性分类头。1

作者省略了不能直接作为分类问题处理的任务,例如 L3b、L3c 和 L3d;也省略了对线性探测而言过于简单的任务,例如 L1a 和 L1b。

E-mode II:知识提示式 LLM 评估

给定一幅测试图像及其对应的特定任务标签后,作者通过查询专家知识库 EyeWiki,将标签转换为间接描述。随后,该描述会与图像和问题一同提供给模型。1 8

示例:L2b 左右眼别识别

请根据图像、描述与问题选择最合适的选项,并直接回答选项字母。
描述: 眼底图像中的中央凹位于视盘左侧。
问题: 这幅图像显示的是左眼还是右眼?
选项: A. 左眼;B. 右眼。

说明性示例:L3a 硬性渗出识别

请根据图像、描述与问题选择最合适的选项,并直接回答选项字母。
描述: 眼底图像显示边界清晰的白色或黄色沉积物。
问题: 这幅眼底图像是否显示硬性渗出的证据?
选项: A. 否;B. 是。

该示例仅用于说明提示词结构,并非发布标注中的逐字记录。

E-mode III:整体评估

该模式对 MLLM 进行端到端评估。1

4.4 性能指标

论文将其主要指标称为“F1”,但其定义与实现采用的是敏感度和特异度的调和平均数:

HSe,Sp=2 Se SpSe+Sp.H_{Se,Sp}=\frac{2\,Se\,Sp}{Se+Sp}.

这与标准 F1 分数不同,后者是精确率与召回率的调和平均数。对于多分类任务,实现会对各类别的 HSe,SpH_{Se,Sp} 分数求平均,再在子任务、任务和层级之间进行分层聚合。因此,该结果更适合称为论文的复合分数或 HSe,SpH_{Se,Sp},而不是传统 F1 或准确率。1 7

5. 在 FunBench 上评估 MLLM

5.1 MLLM 的选择

作者选择了 7B/8B 规模的 MLLM,包括六个通用模型和三个医学模型,如表 2 所示。此外,作者还加入 GPT-4o 作为闭源基线,并加入 DINOv2-large 作为 VE 基线。1

表 2. 论文所评估的开源 MLLM。医学模型以 * 标记。 1(表 2)

MLLMHugging Face 发布时间VELLM
LLaVA-v1.5-7B2023.10CLIP-ViTVicuna-7B
*Qilin-Med-VL-Chat2023.12CLIP-ViTChinese-LLaMA2
LLaVA-v1.6-7B2024.01CLIP-ViTVicuna-7B
*LLaVA-Med-v1.5-7B2024.05CLIP-ViTMistral-7B
Qwen2-VL-7B2024.09Qwen2-ViTQwen2-7B
InternVL2.5-8B2024.12InternViTInternLM2.5-7B
*HuatuoGPT-Vision-7B2024.06CLIP-ViTQwen2-7B
Janus-Pro-7B2025.01ViT-SigLIPDeepSeek-LLM-7B
Qwen2.5-VL-7B2025.01Qwen2.5-ViTQwen2.5-7B

5.2 结果

VE 对比

不同 VE 的表现见表 3 的 E-mode I 部分。1

主要结果如下:

  1. 在所测试的冻结编码器线性探测协议及聚合评分流程下,DINOv2 是表现最佳的 VE,而 CLIP-ViT 在所评估编码器中得分最低。
  2. VE 在 L4b 上的表现甚至低于随机水平。

作者认为,这些结果表明纯视觉方案在眼底图像分析上存在局限。我认为这一结论应仅限于所测试的视觉表征与线性探测协议;它不能证明非线性读出、经过微调的视觉模型或所有纯视觉方法都存在同样的局限。

LLM 对比

LLM 的结果见表 3 的 E-mode II 部分。1

主要结果如下:

  1. 在知识提示条件下,InternVL2.5、HuatuoGPT-Vision、Qwen 等系统能够利用由标签派生的眼科描述回答部分眼底图像解读问题。由于该模式仍然包含图像,并使用由参考标签派生的描述,因此它并不是对 LLM 知识的纯粹测量。
  2. 各系统在不同任务上的表现不一致。例如,它们在 L4c 上明显优于 L4d。两者都是疾病特异性分类任务,但标签、数据与难度并不匹配。
  3. L2b 的表现接近随机水平。

作者对第二项结果的解释是:网络上的 DR 相关材料可能比 AMD 相关材料更丰富,因此 LLM 更熟悉 DR。对于 L2b 表现不佳,尽管这是一个简单任务,作者认为这种技能可能过于基础,很少被专门讨论,因此相关训练数据较少。

作者据此认为,结果揭示了当前数据驱动范式的一项根本局限:它会生成能力强大的模型,却未必具备基础的眼底图像解读技能。

MLLM 对比

MLLM 的表现汇总于表 3 的最后一部分。1

  1. 在所测试的开源 MLLM 中,HuatuoGPT-Vision 表现最佳,其后是 Qwen2-VL 和 InternVL2.5;若计入闭源基线,GPT-4o 的总体得分最高。
  2. HuatuoGPT-Vision 与 Qwen2-VL 使用相同架构的 LLM——Qwen2-7B,但前者的 VE(CLIP-ViT)在实验中不如后者的 VE(Qwen2-ViT)。这与领域特异性微调可能带来收益的解释一致,但该比较无法将这一因素与视觉编码器、连接器、训练数据或训练流程的差异隔离开来。
  3. 如表 4 所示,整体模型排名与知识提示条件下排名的相关性,高于其与 VE 线性探测排名的相关性。但这种关联并不能证明任一模块的因果贡献。

作者指出,所评估 MLLM 的眼底图像解读能力相当有限,并认为相关性分析凸显了开发强大眼科 LLM 的迫切需求。

表 4. 基于平均性能排名的相关性分析。 1(表 4)

模块与 MLLM 的 Spearman 相关系数
LLM0.917
VE0.055

5.3 结论

  • 所评估的 MLLM 在涉及解剖感知、病变分析和疾病诊断的眼底图像解读任务上仍然较弱。
  • 作者将结果解释为模型对 LLM 的依赖高于 VE;但报告的相关性本身不能证明因果依赖。
  • HuatuoGPT-Vision 的表现与领域特异性训练可能有益的解释一致,但该比较无法隔离这一因素。
  • 未来的训练流程需要考虑完整的眼底图像解读技能范围,否则我们可能会开发出缺乏基础眼底图像解读能力的 MLLM。1

6. 我的评论

作者提供了一个合理的 MLLM 眼底图像解读能力评估基准。我们可以将其改造后用于评估自己的模型或智能体工作流,也可以把它的任务组织方法扩展到其他领域。公开的代码与标注提供了实用起点,但准备原始图像、适配模型接口,以及为智能体定义工具访问权限与推理预算,仍然需要额外工作。2 3

此外,还有几个问题值得注意。

在我检查的公开仓库版本中,没有找到 E-mode I 的特征提取与线性探测训练流程(见 issue #2)。这一观察只针对所检查的仓库版本,并不能证明实现不存在于其他位置。

作者对结果的部分解释与假设还不够有说服力。

例如,作者认为 AMD 表现差于 DR 与相关训练材料的相对数量有关。观察到的性能差异确实能启发这一假设,但论文没有直接证据说明模型训练数据中 DR 与 AMD 的相对覆盖程度。图像难度、类别定义和问题设计的差异仍然可能是替代解释。

把简单的左右眼别识别任务(L2b)解释为一种罕见技能,同样缺乏充分说服力。误差的一种可能来源是坐标或观察视角约定不明确:图像空间中的左右、解剖学眼别和患者视角必须加以区分。水平翻转增强也可能影响方向敏感性,但这一可能性需要明确的对照实验;平移本身不会交换左右。此外,线性探测在眼别任务上相对较好的结果说明视觉特征中仍然可以读出有效的眼别信息,尽管探测器可能利用了间接线索。因此,错误也可能出现在连接器、提示词理解或答案映射环节。

我最关心的是对 E-mode II 的解释。作者同时提供图像和由参考标签派生的描述,因此该条件包含有特权的真实标签信息。这种设置可用于诊断——例如检验当相关语义证据被直接提供时,系统能否正确作答——但它并不是纯粹的 LLM 评估。E-mode I 与 II 所使用的信息、监督方式和支持的任务也不同,因此比较两者无法隔离 LLM 与 VE 的因果重要性。报告的排名相关性同样只能说明关联,而不能说明因果。1 8

仅提供描述的条件可以帮助检验:当给出由标签派生的描述后,图像是否仍然作出贡献,尽管这仍不能完成严格的模块分解。其他对照可以包括空白、打乱或无关图像;由未接触参考标签的专家撰写描述;以及受控的模块替换实验。同时,也应承认作者提出的顾虑:纯文本输入未必代表 LLM 经多模态适配后的行为。

尽管论文提供了有用的 VE 与 LLM 针对性评估,但模块分离并不彻底。端到端评估与预期的图像使用场景更直接相关,不过仍需通过不同随机种子、提示词变体和输入扰动下的重复测试来验证其稳定性。

参考文献

  1. Wei, Q., Qian, K., and Li, X. FunBench: Benchmarking Fundus Reading Skills of MLLMs. MICCAI 2025, LNCS 15965, pp. 278–288. DOI · 开放获取稿件。
  2. RUC AIMC Lab. FunBench 源代码与准备说明。 代码仓库。
  3. AIMClab-RUC. FunBench VQA 标注。 Hugging Face 数据集。
  4. Hu, Y., et al. OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM. CVPR 2024. 会议论文页面。
  5. Chen, P., et al. GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI. NeurIPS 2024. 会议论文页面。
  6. Qin, Z., et al. LMOD: A Large Multimodal Ophthalmology Dataset and Benchmark for Large Vision-Language Models. Findings of NAACL 2025. ACL Anthology。
  7. RUC AIMC Lab. evaluate.py。 固定版本源代码。
  8. RUC AIMC Lab. predict.py。 固定版本源代码。
  9. 关于 emod1 评估的提问。 FunBench GitHub issue #2。Issue。

评论

登录 — 登录后参与讨论。

  1. …