| 1 |
Can Large Language Models Explain Flight Safety Events? A Prior-Guided Semantic LLM-based Approach |
提出FlightLLM以解决飞行安全事件解释问题 |
large language model |
|
|
| 2 |
Communicating Credit Risk with Large Language Models: Evaluation of Explanations from Standard and Alternative Data-Based Models |
利用大型语言模型提升信用风险解释的可理解性 |
large language model |
|
|
| 3 |
LiveHouse-TS: An Open-world Living Benchmark for Time Series Foundation Models |
提出LiveHouse-TS以解决时间序列模型评估的动态性问题 |
foundation model |
|
|
| 4 |
ARASH: Adaptive Retrieval And Shot Selection for Tabular Prediction |
提出ARASH以解决表格预测中的检索与选择问题 |
large language model foundation model |
|
|
| 5 |
StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows |
提出StartupBench以评估通用智能体在市场验证工作流中的表现 |
large language model instruction following |
|
|
| 6 |
What Aggregate Scores Miss: Measuring Item-Level Regressions in Commercial LLM API Migrations |
提出细粒度评估方法以解决LLM API迁移中的评分失真问题 |
large language model instruction following |
|
|
| 7 |
Mixture-of-Expert Blocks Contain Strong Hallucination Detection Signals |
提出InnerExpert以解决大语言模型幻觉检测问题 |
large language model |
|
|
| 8 |
When to Review: Spaced Repetition for Continual Pre-Training of Language Models |
提出间隔重复训练以解决语言模型持续预训练中的知识遗忘问题 |
large language model |
|
|
| 9 |
AdaLens: Interactive Storyline for Monitoring and Steering Long-Running Agentic Data Analysis |
提出AdaLens以解决长时间运行的数据分析监控与引导问题 |
large language model |
|
|
| 10 |
DEPT: Document Embedding Preservation Tuning for Unified Query Expansion and Retrieval |
提出DEPT以解决文档嵌入保持与查询扩展问题 |
large language model |
✅ |
|
| 11 |
HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety |
提出HarnessRisk以评估智能体安全性在不同阶段的表现 |
large language model |
|
|
| 12 |
Agent Lightning v1.0: Towards Harnessed Agentic RL |
提出Agent Lightning v1.0以解决传统强化学习中的环境交互问题 |
instruction following |
|
|
| 13 |
SAGE: Self-Evolving Storyboard Skills via Attribution-Guided Rule Evolution |
提出SAGE框架以解决自动化故事板制作中的知识获取与演化问题 |
large language model |
✅ |
|
| 14 |
Structure-Internalized Rule Language Model for Faithful Knowledge Graph Reasoning |
提出结构内化规则语言模型以解决知识图谱推理中的证据感知漂移问题 |
large language model |
|
|
| 15 |
LLM-Only PDDL Domain Repair with Open-Weight Models |
提出LLM仅基于PDDL模型修复的方法以解决自动化规划问题 |
large language model |
|
|
| 16 |
TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration |
提出TileMix以解决大语言模型推理中的计算与内存瓶颈问题 |
large language model |
✅ |
|
| 17 |
PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs |
提出PlanPO以解决多轮交互任务中的策略优化问题 |
large language model |
|
|
| 18 |
DeAR: Decentralized Agentic Reasoning via Capability Grounding and Collaborative Thought Navigation |
提出DeAR框架以解决集中式推理系统的瓶颈问题 |
multimodal |
|
|
| 19 |
Do LLMs Know a Good Hypothesis When They See One? Logit-Based Energy Scoring Outperforms Prompted LLM-as-Judge for Scientific Hypothesis Ranking |
提出基于logit的能量评分方法以提升科学假设评估 |
large language model |
|
|
| 20 |
PACE: Policy-Attested Contract Execution for Safe AI Agents in Decentralized Finance |
提出PACE框架以解决去中心化金融中AI代理的安全性问题 |
large language model |
|
|