Causal Evidence Extraction and Triangulation in Crisis Reports using Large Language Models: A ReliefWeb-based Study

📄 arXiv: 2608.04576v1 📥 PDF

作者: Yuanjun Zhang, Mourad Oussalah

分类: cs.CL

发布日期: 2026-08-05

期刊: Findings of the Association for Computational Linguistics: ACL 2026, pages 32478-32491, 2026

DOI: 10.18653/v1/2026.findings-acl.1626


💡 一句话要点

提出基于大语言模型的因果证据提取与三角测量方法以解决人道主义报告中的信息整合问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 因果证据提取 大语言模型 人道主义报告 决策支持 三角测量 数据整合 机器学习

📋 核心要点

  1. 人道主义报告冗长且多主题,导致因果证据整合困难,现有方法难以有效提取决策相关信息。
  2. 提出了一个两阶段的LLM管道,通过查询条件提取和片段基础链接来提高因果证据的提取精度和审计性。
  3. 在100份报告的实验中,最佳模型实现了94.15%的加权F1分数,显示出显著的性能提升和成本效率。

📝 摘要(中文)

人道主义报告通常冗长、噪声多且涉及多个主题,导致决策相关的因果证据难以整合。本文基于ReliefWeb(2000-2024)的研究,提出了一个两阶段的大语言模型(LLM)管道,能够提取具有方向和强度属性的结构化干预-结果记录。通过查询条件提取限制输出到特定干预类别,减少检索引起的过度提取,同时片段基础链接每个关系到支持文本,以便审计和分类。在100份专家标注的数据集中,最佳闭源LLM达到了90.73%的加权F1分数,而经过监督微调的Llama-3.1-8B达到了94.15%的加权F1分数。我们进一步提出了保持上下文的三角测量方法,在灾害×来源单元内聚合强度加权证据,应用拉普拉斯平滑并均等加权单元,以量化跨上下文收敛的证据水平得分。

🔬 方法详解

问题定义:本文旨在解决人道主义报告中因果证据提取的困难,现有方法在处理冗长和多主题文本时存在信息整合不足的问题。

核心思路:通过构建一个两阶段的LLM管道,结合查询条件提取和片段基础链接,旨在提高因果证据的提取精度和可审计性。

技术框架:整体架构分为两个主要阶段:第一阶段为查询条件提取,限制输出到特定干预类别;第二阶段为片段基础链接,将提取的关系与支持文本关联。

关键创新:提出了上下文保持的三角测量方法,能够在灾害×来源单元内聚合证据,并通过拉普拉斯平滑量化跨上下文的收敛性,这在现有方法中尚属首次。

关键设计:在模型训练中,采用了监督微调的策略,优化了损失函数以提高加权F1分数,同时在证据聚合中均等加权单元以确保结果的稳定性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,最佳闭源LLM在100份专家标注报告中达到了90.73%的加权F1分数,而经过监督微调的Llama-3.1-8B模型则达到了94.15%的加权F1分数,显示出显著的性能提升,且在现金援助领域的应用中,食物相关结果表现出强正收敛性(LoE=0.865)。

🎯 应用场景

该研究的潜在应用领域包括人道主义援助决策支持、灾害管理和政策制定等。通过有效提取和整合因果证据,能够帮助决策者更好地理解干预措施的效果,从而优化资源配置和应对策略,具有重要的实际价值和未来影响。

📄 摘要(原文)

Humanitarian reports are long, noisy, and multi-topic, making it difficult to consolidate decision-relevant causal evidence. We present a ReliefWeb study (2000-2024) and a two-stage Large Language Model (LLM) pipeline that extracts structured intervention-outcome records with direction and strength attributes. Query-conditioned extraction restricts output to a specified intervention class, reducing retrieval-induced over-extraction, while snippet grounding links each relation to supporting text for auditability and classification. In an expert-annotated dataset of 100 reports, the best closed-source LLM achieved a weighted F1 score of 90.73% with strong cost-efficiency, while Llama-3.1-8B with supervised fine-tuning reached 94.15% weighted F1 score. We further propose context-preserving triangulation that aggregates strength-weighted evidence within disaster$\times$source cells, applies Laplace smoothing and equally weights cells to quantify cross-context convergence via a Level-of-Evidence score. Applied to cash assistance, food-related outcomes show strong positive convergence (LoE=0.865) and stable long-horizon trajectories.