| 1 |
Legibility is Not Interpretability: Comparing Judged and Actual Importance in Chain-Of-Thought Reasoning |
提出基于优势评估的推理步骤重要性分析方法 |
chain-of-thought |
|
|
| 2 |
Knowledge Acquisition During Pre-training? Large Language Models Learn Better With Auxiliary Views |
提出辅助视角以提升大型语言模型的知识获取能力 |
large language model |
|
|
| 3 |
Investigating the Ability of Large Language Models to Analyze Recipes for Diabetes |
研究大型语言模型分析糖尿病食谱的能力 |
large language model |
|
|
| 4 |
IndicSafeEval: Safety Robustness of Large Language Models under Multilingual Persuasive Jailbreak Attacks |
提出IndicSafeEval框架以评估多语言环境下LLM的安全性 |
large language model |
✅ |
|
| 5 |
The Dice Roll Method: A Standardized Protocol for Repeated-Query Auditing of Large Language Model Brand Recommendations |
提出骰子投掷法以解决大语言模型品牌推荐审计问题 |
large language model |
|
|
| 6 |
Evaluating Criterion-Conditioned Behaviour of Large Language Models in Content Moderation |
提出DECO方法以解决LLMs内容审核中的标准化问题 |
large language model |
|
|
| 7 |
Typological Feature Prediction with Large Language Models: An In-Context Learning Approach |
利用大型语言模型进行类型特征预测以解决可解释性不足问题 |
large language model |
|
|
| 8 |
KhatianDoc: A Human-Verified Benchmark Diagnosing Multimodal LLM Failure on Bengali Legal Land Records |
提出KhatianDoc基准以解决孟加拉法律土地记录的多模态LLM识别问题 |
multimodal |
|
|
| 9 |
To What Extent Do Large Language Models Understand Bangla Idioms? |
提出孟加拉语习语理解基准数据集以提升LLM性能 |
large language model |
|
|
| 10 |
How Perturbations Propagate: A Multi-Level Analysis of Robustness in Large Language Models |
提出多层次分析方法以评估大语言模型的鲁棒性 |
large language model |
|
|
| 11 |
Flip, Don't Shuffle: Watermarking LLMs at the Speed of Inference |
提出无状态伯努利水印以提升大语言模型的水印效率 |
large language model |
|
|
| 12 |
What Else Needs Fixing? Exploring Cost-Effective Test-Time Compute for Revision Propagation in Artifacts Generated Through Conversation |
提出成本有效的测试时计算方法以优化对话生成的修订传播 |
large language model |
✅ |
|
| 13 |
Representational alignment yields generalizable safety in language models |
提出表征对齐方法以提升语言模型的安全性 |
large language model |
|
|
| 14 |
Beyond BLEU: A Case for Redefining Sign Language Translation Benchmarks |
提出新评估方法以改进手语翻译基准 |
multimodal |
|
|
| 15 |
</think> Doesn't Stop Reasoning: Analysis of Spurious CoT Termination |
提出EoT注入策略以解决CoT推理终止问题 |
chain-of-thought |
✅ |
|
| 16 |
Remember and Reweight: Enhancing Multi-Agent Debate with Experience Memory and Confidence Estimation |
提出R²-MAD以解决多代理辩论中的共享误解问题 |
large language model |
|
|
| 17 |
When Users Don't Ask: Benchmarking Context-Driven Memory Retrieval in Conversational Agents |
提出LOCOMO-CONV基准以解决对话代理中的记忆检索问题 |
large language model |
|
|
| 18 |
CROCODIL: Cross-Model Code Editing with LLMs |
提出CROCODIL以解决跨模型代码编辑中的过度修改问题 |
large language model |
✅ |
|
| 19 |
What Do CAE Simulation Agents Really Need Beyond a Generic Harness? |
提出CAE仿真代理以优化仿真设置与执行效率 |
large language model |
|
|
| 20 |
Lost in Reordering: Structural Sensitivity of Multilingual LLMs under Semantics-Preserving Perturbations |
研究多语言LLM在语义保持扰动下的结构敏感性 |
large language model |
|
|
| 21 |
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning |
提出随机注意力机制以解决KV缓存驱逐效率问题 |
large language model |
✅ |
|
| 22 |
FrameBench:A Language Understanding Benchmark Based on Frame Semantics |
提出FrameBench基准以解决语言理解中的隐性信息问题 |
large language model |
✅ |
|
| 23 |
SGD-KV: Summarization Guided KV Cache Compression |
提出SGD-KV以解决长上下文推理中的KV缓存压缩问题 |
large language model |
|
|