| 1 |
When Linguistic and Internal Confidence Diverge in Large Language Models |
研究语言模型信心报告与内部信心的差异 |
large language model |
|
|
| 2 |
Benchmarking large language model agent societies against human behavioural distributions |
提出SILICA工具以评估语言模型代理社会行为 |
large language model |
|
|
| 3 |
Twin Worlds: Equivariance-Based Abstention for Evidence-Grounded Reasoning |
提出Twin Worlds框架以解决知识密集型推理中的不确定性问题 |
large language model |
|
|
| 4 |
OpenStamp: A Watermark for Open-Source Language Models |
提出OpenStamp以解决开源语言模型水印问题 |
large language model |
|
|
| 5 |
SimpCue: Cue-Based Prompting for Multilingual Text Simplification |
提出SimpCue以解决多语言文本简化中的提示信息不足问题 |
large language model |
|
|
| 6 |
LandingAgent: A Reference-Annotated Dataset and Agentic Generation Framework for Landing Pages |
提出LandingAgent框架以优化目标导向的落地页生成 |
large language model |
✅ |
|
| 7 |
A Formal Limitation on Learning Human Language From Textual Corpora |
提出信息论框架以界定语言理解的极限 |
large language model |
|
|
| 8 |
Phoneme- and Word-Level Metrics Using Self-Supervised Speech Representations for Forced Alignment Evaluation |
提出基于自监督语音表示的无参考强对齐评估指标 |
TAMP |
✅ |
|
| 9 |
ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL |
提出ContextPilot以解决长时代理任务中的上下文管理问题 |
large language model |
✅ |
|
| 10 |
CultureConverse: A Multilingual Multi-turn Simulation Harness for Culturally Grounded Assistance in East and Southeast Asia |
提出CultureConverse以解决多轮文化背景对话的评估问题 |
large language model |
|
|
| 11 |
PersonaForge: Realistic Multi-Turn User Simulation for Agentic Systems |
提出PersonaForge以解决多轮用户交互模拟问题 |
large language model |
|
|
| 12 |
H-Scale: Hessian-Guided Scale Refinement for NVFP4 Sub-Byte LLM Inference |
提出H-Scale以解决NVFP4量化模型推理中的尺度选择问题 |
large language model |
|
|
| 13 |
A Shaky Voice Is Not Always a Dodge: Benchmarking Textual and Vocal Evasion Detection in Earnings Calls |
提出DualEvasion以解决财报电话会议中的多维规避检测问题 |
multimodal |
|
|
| 14 |
Beyond Global Scalars: Synergizing Token-Level Statistics and Deep Semantics for Adversarial AIGC Text Detection |
提出MOSAIC基准与NeuroStat框架以解决对抗性文本检测问题 |
large language model |
✅ |
|
| 15 |
QUORUM: QUality-Optimized Routing Using Multiple annotators |
提出QUORUM以解决数据标注质量与成本问题 |
large language model |
✅ |
|
| 16 |
AI Writers Have a Consistent Stylometric Footprint, but AI Editors Do Not |
揭示AI生成与编辑文本的风格特征差异 |
large language model |
|
|