| 1 |
RESPClinBench: Benchmarking Multimodal Clinical Decision-Making and Longitudinal Disease Management in Respiratory Specialty Care |
提出RESPClinBench以解决呼吸专科临床决策不足问题 |
large language model multimodal |
|
|
| 2 |
ODRA: Synthesizing Cognitive Behavioral Therapy Sessions with Structured Chain-Of-Thought and Dynamic Patient Resistance |
提出ODRA框架以解决合成认知行为疗法会话中的患者抵抗问题 |
chain-of-thought |
|
|
| 3 |
When Absence Is Evidence: Evaluating Completeness-Sensitive Negative Reasoning in Large Language Models |
提出CROWN-QA以解决大语言模型的完整性敏感负推理问题 |
large language model |
|
|
| 4 |
IslamicTurathBench: A Multi-Task, Multi-Discipline Benchmark for Evaluating Large Language Models on the Islamic Scholarly Tradition (turath) |
提出IslamicTurathBench以评估大型语言模型在伊斯兰学术传统中的表现 |
large language model |
|
|
| 5 |
Causal Evidence Extraction and Triangulation in Crisis Reports using Large Language Models: A ReliefWeb-based Study |
提出基于大语言模型的因果证据提取与三角测量方法以解决人道主义报告中的信息整合问题 |
large language model |
|
|
| 6 |
DataRx: Missingness-Aware Sampling for Safer Large Language Model Task-Specific Fine-Tuning |
提出DataRx以解决大语言模型任务特定微调中的安全性问题 |
large language model |
|
|
| 7 |
Protoreasoning in Tiny Transformers |
提出原型推理方法以提升小型变换器的推理能力 |
large language model chain-of-thought |
|
|
| 8 |
Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark |
提出ProverbIT基准以评估LLM对意大利谚语的理解能力 |
large language model chain-of-thought |
|
|
| 9 |
Does Out-of-Sight Equal Out-of-Mind in CoT Monitorability? |
提出基于提示干预的CoT监控方法以提高模型可监控性 |
large language model chain-of-thought |
|
|
| 10 |
Representing Visual Evidence for Item Difficulty Prediction: Visual Textualization and Image-Native Modeling |
提出视觉证据表示方法以解决项目难度预测问题 |
large language model |
|
|
| 11 |
Chained Recursive Language Models for Multi-Iteration Reasoning |
提出链式递归语言模型以解决多轮推理问题 |
large language model |
|
|
| 12 |
D$^2$F-ReAG: Dynamic Decomposition and Filtering for Multi-Hop Reasoning-Augmented Generation |
提出D2F-ReAG以解决多跳推理生成中的知识依赖问题 |
large language model |
|
|
| 13 |
Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models |
提出口语功能调用以解决开放领域语音理解问题 |
large language model |
|
|
| 14 |
Strengthening Target-Language Features: SAE-Based Steering for Multilingual Inference |
提出基于稀疏自编码器的多语言推理引导方法 |
large language model |
|
|
| 15 |
Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses? |
提出Skill-Use基准以评估LLM在技能应用中的能力 |
large language model |
|
|
| 16 |
When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents |
研究空间记忆过时性以提升VLM代理的安全性 |
visual grounding |
|
|
| 17 |
K-EXAONE 2.0 Technical Report |
提出K-EXAONE 2.0以提升多语言模型能力 |
foundation model |
|
|
| 18 |
Social Pressure Breaks Majority Voting in LLM Safety Panels |
研究社交压力对大型语言模型安全评估的影响 |
large language model |
|
|
| 19 |
EdgeLM: Edge Demonstrations for Language Models' Table Understanding |
提出EdgeLM以解决语言模型表格理解中的演示选择问题 |
large language model |
✅ |
|