| 1 |
Embedded Conditional Independence Tests for Large Language Model Generated Text with an Application to German Parliament Speeches |
提出嵌入式条件独立性检验以分析语言模型生成文本 |
large language model multimodal |
|
|
| 2 |
MIDR: Enrichment-Augmented Indexing for Multimodal Document Retrieval |
提出MIDR以解决多模态文档检索中的表示问题 |
multimodal |
|
|
| 3 |
Differentially Private Paired Table-Image Multimodal Synthesis |
提出DP-TabImage以解决多模态数据隐私合成问题 |
multimodal |
✅ |
|
| 4 |
A Composable Evaluation System for Reproducible Omni-Modal Foundation Model Evaluation |
提出可组合评估系统以解决多模态基础模型评估问题 |
foundation model |
✅ |
|
| 5 |
H2Table: Hierarchical Hypergraph-Enhanced Large Language Models for Complex Table Reasoning |
提出H2Table以解决复杂表格推理问题 |
large language model |
✅ |
|
| 6 |
VIBE-Bench: Evaluating Personalized Large Language Models When Profiles Don't Mean Preferences |
提出VIBE-Bench以解决个性化大语言模型中的偏好推理问题 |
large language model |
|
|
| 7 |
Latent Recurrent Thoughts: Recurrent Refinement of Proposed Latents for Reasoning with Frozen LLMs |
提出潜在递归思维以提升冻结LLM的推理能力 |
large language model chain-of-thought |
|
|
| 8 |
AgentFactory: Towards Automated Agentic System Design and Optimization |
提出AgentFactory以解决自动化智能系统设计与优化问题 |
large language model foundation model |
|
|
| 9 |
Neuro-Symbolic Geometric Abstraction (NeuSOGA): From Observations to Symbolic Mathematical Representations |
提出NeuSOGA以解决观察到的几何数据转化为符号数学表示的问题 |
foundation model |
|
|
| 10 |
Measuring consistency via ensemble margin and local prediction variability: Auditing decision systems in the presence of predictive multiplicity |
提出一致性测量方法以审计决策系统中的预测多样性问题 |
large language model |
|
|
| 11 |
Can LLMs Design Video Coding Tools? A Case Study on Planar Mode |
利用大型语言模型设计视频编码工具以优化编码性能 |
large language model |
|
|
| 12 |
When Safety Routing Breaks: Understanding Alignment Fragility under Benign Fine-Tuning |
提出Fisher几何解释以解决大语言模型安全对齐脆弱性问题 |
large language model |
|
|
| 13 |
EDGE: Error Dependency Graph-Guided Multi-Error Attribution in Multi-Agent LLM Systems |
提出EDGE框架以解决多代理LLM系统中的多错误归因问题 |
large language model |
|
|
| 14 |
Automated Event Log Generation from Unstructured Text Using Finetuned LLMs |
提出基于微调大语言模型的自动事件日志生成方法以解决数据结构化问题 |
large language model |
|
|
| 15 |
Prompt-Robust Language Models: Which Training Strategies Work? |
提出针对提示敏感性问题的语言模型训练策略 |
large language model |
|
|
| 16 |
CoBRA: Learning Tool-Use Boundaries via Counterfactual Margins |
提出CoBRA框架以优化工具使用决策 |
large language model |
|
|
| 17 |
RPCBench: A Benchmark for Proactive Premise Critique in LLM-based Recommendation |
提出RPCBench以解决大语言模型推荐中的前提批判问题 |
large language model |
✅ |
|
| 18 |
In-Context Neurofeedback: Can LLMs Control Their Internal Representations through Privileged Access? |
重新设计神经反馈以评估LLMs的内在表征控制能力 |
large language model |
|
|
| 19 |
Replacing Training with Memory: Listwise Selection for Text-to-SQL |
提出无需微调的列表选择器以优化文本到SQL的查询生成 |
large language model |
|
|
| 20 |
Automated Tree Knowledge Graph Construction using Ontology Expansion and Retrieval from Vietnamese History Textbooks |
提出基于本体扩展的自动化树知识图谱构建方法以解决越南语低资源问题 |
large language model |
|
|
| 21 |
ContextPipe: Database-Inspired Context Assembly for Long-Horizon Agents |
提出ContextPipe以优化长时段智能体的上下文组装问题 |
large language model |
|
|
| 22 |
Escaping Redundant Reasoning: Structure-Aware Search for Inference-Time LLMs |
提出BASIN方法以解决推理时间LLMs的冗余推理问题 |
large language model |
✅ |
|
| 23 |
ChatDev 2.0: A No-Code Multi-Agent Platform for Developing Everything |
提出ChatDev 2.0以解决多代理系统开发的复杂性问题 |
large language model |
✅ |
|
| 24 |
Triple-Bottom-Line Sustainability of Language Models for Edge AI: A Comparison Between SLMs and Quantized LLMs |
提出全面可持续性评分以比较边缘AI中的SLMs与量化LLMs |
large language model |
|
|
| 25 |
Predicting Program Exit Code with LLMs and Programming Language Semantics |
提出程序可执行性预测方法以解决LLM理解语义不足问题 |
large language model |
✅ |
|
| 26 |
Same Request, Different Boundary: Evaluating Cybersecurity Assistance across Conversational Contexts |
提出3R-Bench以评估对话上下文中的网络安全请求处理 |
large language model |
|
|
| 27 |
Residual Sparsification via Output Importance for Compressing Mixture-of-Experts LLMs |
提出PARSER以解决Mixture-of-Experts模型压缩中的准确性问题 |
large language model |
|
|
| 28 |
WiseSpec: Requirements-Driven Agents for Code Generation |
提出WiseSpec以解决代码生成中的需求质量问题 |
large language model |
|
|