MAC: A Live Benchmark for Multimodal Large Language Models in Scientific Understanding

发布时间:2026/9/30 2:20:01
MAC: A Live Benchmark for Multimodal Large Language Models in Scientific Understanding MAC相关研究总结与核心部分翻译一、文章主要内容本文聚焦多模态大型语言模型(MLLMs)在科学理解能力评估方面的挑战,提出了一个动态演进的基准测试集MAC(Multimodal Academic Cover benchmark),并针对MLLMs跨模态科学推理能力不足的问题,设计了轻量级推理方法DAD(Description and Deduction)。1. 现有基准测试集的局限性静态基准测试集(如MMMU)随着MLLMs能力提升逐渐饱和,例如Gemini-2.5-pro在MMMU的pass@1设置下准确率已达81.7%,失去对模型发展的指导意义。现有动态基准测试集(如LiveBench)仅关注单一语言模态,且依赖互联网快速变化的内容,在科学理解评估的数据质量上存在隐患。2. MAC基准测试集的构建与特点数据来源:从Nature、Science、Cell、美国化学学会(ACS)等顶级科学期刊中收集超过25,000个图文对,涵盖分子细胞生物学、材料科学、医学、化学等多个学科领域。核心快照:2025年快照MAC-2025包含2024年1月至2025年2月期间的2287个期刊封面-封面故事对,用于当前MLLMs的评估。任务设计:包含Image2Text(给定封面图选对应封面故事)和Text2Image(给定