ORBITER: Conflict-Aware Decision-Making for Agentic Last-Mile Delivery
作者: Mingzhao Li, Chenxi Liu, Yan Zhao, Hao Miao
分类: cs.AI
发布日期: 2026-08-19
💡 一句话要点
提出ORBITER以解决最后一公里配送中的决策冲突问题
🎯 匹配领域: 支柱八:物理动画 (Physics-based Animation)
关键词: 最后一公里配送 决策冲突 时空建模 语言模型 智能物流 快递服务 动态订单 机器学习
📋 核心要点
- 现有学习方法在处理动态订单时,未能有效解释下一订单的决策过程,导致决策不可靠。
- ORBITER通过决策点建模快递员的时空状态,利用语言模型进行决策,并引入独立评论者进行验证。
- 在四个城市的广泛评估中,ORBITER的表现比现有基线平均提升了9.2%,显示出其有效性。
📝 摘要(中文)
最后一公里配送旨在处理动态到达的订单与快递员之间的复杂时空关系。尽管现有基于学习的方法能够建模订单间的时空依赖性,但在下一订单决策上仍存在不足。为此,本文提出了ORBITER,一个用于最后一公里配送的自主订单仲裁者。ORBITER通过决策点建模快递服务,展示快递员的时空状态和可见订单,并揭示局部权衡。固定提议者对候选者进行排名,而结构化报告则识别排名不一致的地方。LLM利用任务特定工具收集证据,独立评论者则检查决策的有效性。实验结果表明,ORBITER在四个城市的数据上平均超越现有最先进基线9.2%。
🔬 方法详解
问题定义:本文旨在解决最后一公里配送中动态订单的决策冲突问题。现有方法在下一订单决策上缺乏解释性,导致决策结果的不可靠性。
核心思路:ORBITER通过决策点建模快递员的时空状态和可见订单,利用语言模型进行推理,并通过独立评论者验证决策的有效性。这样的设计旨在提高决策的透明度和可靠性。
技术框架:ORBITER的整体架构包括决策点、固定提议者、结构化报告和独立评论者。决策点展示快递员的状态和可见订单,提议者对候选者进行排名,报告识别排名不一致的地方,评论者则检查决策的依据。
关键创新:ORBITER的主要创新在于引入了决策点和独立评论者的机制,使得决策过程更加透明,并能够有效处理局部权衡。这与现有方法的直接预测方式形成了鲜明对比。
关键设计:在参数设置上,ORBITER使用固定提议者进行候选者排名,损失函数设计为优化决策的准确性和可靠性,网络结构则结合了语言模型和决策点的特征提取。通过这些设计,ORBITER能够在复杂的配送环境中做出更优决策。
🖼️ 关键图片
📊 实验亮点
在四个城市的实验中,ORBITER的性能超越了现有最先进的基线,平均提升幅度达到9.2%。这一结果表明,ORBITER在处理动态订单决策时的有效性和可靠性,具有重要的实践意义。
🎯 应用场景
该研究的潜在应用领域包括智能物流、快递配送系统和城市交通管理等。ORBITER能够提高最后一公里配送的效率和可靠性,具有显著的实际价值,未来可能推动智能配送技术的发展与应用。
📄 摘要(原文)
Last-mile delivery aims to handle dynamically arriving orders with couriers while modeling complex spatial and temporal correlations. Recent learning-based methods model spatiotemporal dependencies among orders to predict courier service sequences, but leave next-order decision making unexplained. Describing the current delivery state in language allows LLMs to reason explicitly about the spatial, temporal, and behavioral cues behind an individual decision. As direct predictors, however, LLMs remain sensitive to task presentation and often produce unreliable decisions. To address these challenges, we introduce ORBITER, an agentic Order Arbiter for next-order decision-making in last-mile delivery. ORBITER models courier service through decision points, each containing the courier's spatiotemporal state and visible orders and exposing local trade-offs for modeling and verification. Fixed proposers rank the candidates, and a structured report identifies where their rankings disagree. The LLM uses task-specific tools to gather evidence on the leading alternatives, while an independent critic checks the resulting decision against that evidence. We conduct extensive evaluations on data in four cities, where ORBITER outperforms existing state-of-the-art baselines by up to 9.2% on average showing its effectiveness.