MArgE: Meshing Argumentative Evidence from Multiple Large Language Models for Justifiable Claim V...

发布时间:2026/9/30 2:22:01
MArgE: Meshing Argumentative Evidence from Multiple Large Language Models for Justifiable Claim V... 文章主要内容和创新点主要内容本文提出了一种名为MArgE的框架,旨在通过整合多个大型语言模型(LLMs)的论证证据,实现可证明的主张验证(claim verification)。该框架的核心是将多个LLM生成的证据转化为结构化的论证树(argument tree),并利用计算论证(computational argumentation)的语义规则传播论证强度,最终基于整合后的论证强度判断主张的真伪。实验结果表明,MArgE在三个主张验证数据集(TruthfulClaim、StrategyClaim、MedClaim)上的性能显著优于单个LLM(包括开源模型和GPT-4o-mini)、现有论证性LLM(ArgLLMs)以及非结构化的多LLM辩论方法,同时保证了决策过程的透明度和可解释性。创新点结构化证据整合:将多个LLM的输出转化为结构化的论证树(支持或攻击主张的论证),替代非结构化的自由辩论或投票,解决了传统多LLM方法决策过程不透明的问题。论证性推理机制:基于计算论证理论(如定量双极论证框架QBAF),通过渐进语义(如DF-QUAD)传播论证强度,确保最终决策基于明确的逻辑规则,而非模糊的模型聚合。外部评分机制:使用独立的LLM(如GPT-4o-mini)对论证质量进行评分,避免生成模型的自偏误,增强论证强度的客观性。高可解释性:论