| 1 |
InSituMeasure: Probing Situated Measurement Grounding in Industrial Scenes with Multimodal Large Language Models |
提出InSituMeasure以解决工业场景中的测量基础问题 |
large language model multimodal |
|
|
| 2 |
NeoRed: A Knowledge-Logic-Alignment Multimodal Large Language Model for Neonatal Respiratory Disease Diagnosis |
提出NeoRed以解决新生儿呼吸疾病诊断中的多模态数据整合问题 |
large language model multimodal |
|
|
| 3 |
LLM4CKD: Large Language Models for Early Stage Chronic Kidney Disease Screening |
提出LLM4CKD以解决慢性肾病早期筛查问题 |
large language model foundation model |
|
|
| 4 |
IRWOZ 2.0: A Large Language Model-driven Dialogue Dataset for Industrial Robot Conversations |
提出IRWOZ 2.0以解决工业人机对话系统的状态跟踪问题 |
large language model |
|
|
| 5 |
Xiaomi-TabLDM: A Tabular Foundation Model Technical Report |
提出Xiaomi-TabLDM以提升表格数据预测性能 |
foundation model |
|
|
| 6 |
CulturalMenuBench: Probing the Knowledge-Application Gap in Multimodal Culinary Reasoning |
提出CulturalMenuBench以解决多模态烹饪推理中的知识应用差距问题 |
multimodal |
|
|
| 7 |
Do GUI Agents Know When Not to Act? Enabling Conflict-Aware Termination for Multimodal GUI Agents |
提出CONFLICTGUARD以解决多模态GUI代理的冲突感知终止问题 |
multimodal |
|
|
| 8 |
DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents |
提出DuplexSpeechBench-IFEval以评估全双工语音代理的隐式指令遵循能力 |
instruction following |
|
|
| 9 |
Epistemic Warrant for LLM Recommendations: Characterizing the Basis for Reliance When Ground Truth Is Unavailable |
提出认知担保框架以解决LLM推荐信任问题 |
large language model |
|
|
| 10 |
STAIR (STructure Aware Information Retriever): A novel dataset and LLM based retriever for document structure augmentation |
提出STAIR以解决文档结构信息检索问题 |
large language model |
|
|
| 11 |
SimSkill: A Lifelong Learning AI Agent for Autonomous Mastery of Traffic Simulation |
提出SimSkill以实现交通仿真中的自主学习与能力提升 |
large language model |
✅ |
|
| 12 |
Proactive Service Agents: A Unified Decision Framework, Methods, and Evaluation |
提出主动服务代理以解决用户指令依赖问题 |
large language model |
|
|
| 13 |
Can LLMs Extract Architectural Design Decisions from Source Code Commits? - A Preliminary Exploratory Study |
利用大型语言模型提取源代码提交中的架构设计决策 |
large language model |
|
|
| 14 |
HalluPeer: A Taxonomy-driven Benchmark for Detecting Hallucinations in Scientific Peer Reviews |
提出HalluPeer以解决科学同行评审中的幻觉检测问题 |
large language model |
✅ |
|
| 15 |
Dalek: A Constructive Agent Machine |
提出Dalek以实现自我维护与自我进化的智能体机器 |
large language model |
|
|
| 16 |
Caught in the Story: Narrative Captivity in Multi-turn LLMs Conversation |
提出叙事囚禁概念以解决多轮对话中的道德判断偏差问题 |
large language model |
|
|
| 17 |
A Prompt-Engineering Approach to Develop Scalable, Flexible, and Real-Time Hybrid Micro-Level Personalization in a General Purpose AI Teaching Assistant |
提出基于提示工程的框架以实现个性化AI教学助手 |
large language model |
|
|