| 1 |
UNSPECIFIC: General Constraint Synthesis for Breaking Copy-and-Paste Shortcut in LLM Instruction Following |
提出UNSPECIFIC框架以解决LLM指令遵循中的复制粘贴问题 |
large language model instruction following |
✅ |
|
| 2 |
From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch |
提出'Grip on LLMs'框架以评估荷兰政府用大型语言模型 |
large language model |
|
|
| 3 |
Fusion Training for Mathematical Generalization in Large Language Models |
提出思维模式融合以提升大语言模型的数学推理能力 |
large language model |
✅ |
|
| 4 |
How Do Large Language Models Judge Social Attraction? Evidence from Theory-Grounded Persona Ratings Across Multiple LLMs and Humans |
探讨大型语言模型如何评估社会吸引力 |
large language model |
|
|
| 5 |
ELBench: A Multi-Dimensional Benchmark for Education-Facing Large Language Models |
提出ELBench以评估教育领域大语言模型的多维需求 |
large language model |
|
|
| 6 |
How Far Do Foundation Models Transfer to Infant Signals? A Cross-Dataset Transfer Audit with a Unified Need Ontology |
提出跨数据集转移审计方法以解决婴儿哭声信号分析问题 |
foundation model |
|
|
| 7 |
Pragmatic Attack Surface: Vulnerabilities of Implicit Context in Large Language Models |
提出实用攻击面以解决大语言模型隐式上下文脆弱性问题 |
large language model |
|
|
| 8 |
Subjective Multi-Bias Detection with Large Language Models |
提出主观多偏见检测方法以解决文本偏见问题 |
large language model |
✅ |
|
| 9 |
LexKairos: Benchmarking Legal Temporal Capabilities in LLMs |
提出LexKairos以评估法律领域LLMs的时间能力 |
large language model chain-of-thought |
✅ |
|
| 10 |
REFRAMED: Towards Realistic Audio Description Generation for Movies |
提出REFRAMED以解决电影音频描述生成的挑战 |
multimodal |
|
|
| 11 |
Consilience for Verifier-Free Test-Time Scaling |
提出Consilience框架以解决现有VF-TTS方法的局限性 |
large language model |
|
|
| 12 |
Verifiably grounded machine interpretation of lunar geology |
提出多模态视觉语言架构以实现月球地质的自动化解读 |
multimodal |
|
|
| 13 |
TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability |
提出TCS-Bench以评估生成AI在理论计算机科学研究中的能力 |
large language model |
|
|
| 14 |
Build it, Break it, Repeat: Benchmarking and improving LLM-manipulated disinformation detection in social media posts |
提出BiBiR框架以提升社交媒体虚假信息检测能力 |
large language model |
|
|
| 15 |
How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review |
探讨修辞选择如何影响AI评审判断以应对奖励黑客问题 |
large language model |
|
|
| 16 |
Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness |
提出Decoding-Level Taboo以解决LLM鲁棒性评估问题 |
large language model |
|
|
| 17 |
PragMatch: Separating Pragmatic Incongruity from Cross-Modal Mismatch in Large Vision-Language Models |
提出PragMatch以解决多模态讽刺检测中的实用不一致性问题 |
multimodal |
|
|
| 18 |
MDB-Link: Hierarchical Schema Linking for Multi-Database Text-to-SQL |
提出MDB-Link以解决多数据库文本到SQL查询问题 |
large language model |
|
|
| 19 |
Mawqif-v2: An Arabic Benchmark Dataset for Cross-Target Stance Detection |
提出Mawqif-v2数据集以解决阿拉伯语跨目标立场检测问题 |
large language model |
|
|
| 20 |
EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models |
提出EmoS框架以评估和提升语言模型的情感智能 |
instruction following |
|
|
| 21 |
Evo-Bench: Can Language Models Improve Agent Harness? |
提出Evo-Bench以评估智能体自我优化能力 |
large language model |
|
|
| 22 |
Measuring the Tokenization Premium: A Cost Audit for Underserved Language Communities |
提出Tokenization Equity Audit以解决语言社区的公平性问题 |
large language model |
|
|