| 1 |
Attention-Path Fragility as an Uncertainty Signal in Large Language Models |
提出ASMI以解决大语言模型的不确定性问题 |
large language model |
|
|
| 2 |
FaithformBench: Benchmarking Faithfulness of Mathematical Chain-of-Thought Autoformalisation |
提出FaithformBench以评估数学链式推理自动形式化的可信度 |
chain-of-thought |
|
|
| 3 |
SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information |
提出SPIEval基准以评估大语言模型在移动助手中的表现 |
large language model |
✅ |
|
| 4 |
From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Models |
提出MPAR-Bench以评估大语言模型的多点关联推理能力 |
large language model |
|
|
| 5 |
VisEditBench: Can Vision-Language Models Edit Visualization Code from Multimodal Feedback? |
提出VisEditBench以解决多模态反馈下可视化代码编辑问题 |
multimodal |
✅ |
|
| 6 |
ReLTEx: Reliable LLM-based Taxonomy Expansion |
提出ReLTEx框架以解决LLM生成分类法扩展的可靠性问题 |
large language model |
|
|
| 7 |
VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World? |
提出VibeLifeBench以评估生活助手的主动性与持续性 |
large language model |
|
|
| 8 |
The Illusion of Cross-Lingual Safety in Low-Resource Languages |
提出LoDNA数据集以解决低资源语言的跨语言安全问题 |
large language model |
|
|
| 9 |
TEAMMix: Taxonomy Enrichment Augmentation and Minority-augmented Mixing Strategy for LLM-enhanced Weak-Supervised Hierarchical Text Classification |
提出TEAMMix以解决层次文本分类中的标签不平衡问题 |
large language model |
|
|
| 10 |
Self-Knowledge Retrieval Augmented Generation Framework for Patent Matching |
提出自知识检索增强生成框架以解决专利匹配问题 |
large language model |
|
|
| 11 |
Mitigating Context Interference for Reliable and Efficient Search Agents |
提出基于蒸馏的上下文精炼方法以解决多轮搜索代理的干扰问题 |
large language model |
|
|
| 12 |
EVIL-Detect for NLPCC 2026 Shared Task 6: LLM-Generated Text Detection |
提出EVIL-Detect以解决LLM生成文本检测问题 |
large language model |
✅ |
|
| 13 |
Every Token Counts: Exact Likert-Scale Distributions for Measuring LLM Attitudes and Biases |
提出精确Likert量表分布以评估LLM的态度与偏见 |
large language model |
|
|
| 14 |
Calibrating Post-Training Feature Shifts for LLM Data Contamination Detection |
提出CalibDCD以解决大语言模型数据污染检测中的特征偏移问题 |
large language model |
|
|
| 15 |
VoxSumm: A Multilingual Corpus of Long-Form Spoken News for Joint Summarization and Translation |
提出VoxSumm以解决长语音内容的摘要与翻译问题 |
instruction following |
|
|