Competitive Market Behavior of LLMs
作者: Pawel Struski, Jakub Swistak, Inez Okulska, Przemyslaw Biecek
分类: cs.MA, cs.AI, econ.GN
发布日期: 2026-09-02
💡 一句话要点
探讨大型语言模型在市场机制中的竞争行为
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 市场机制 双重拍卖 资源配置 经济代理 链式思维 实验研究
📋 核心要点
- 现有研究缺乏对大型语言模型作为市场参与者的有效性和适应性的实证分析。
- 本文通过在双重拍卖环境中替换人类受试者为LLM代理,探索其在市场机制中的表现。
- 实验结果表明,LLM代理市场的资源配置效率低于人类市场,且个体决策存在显著异质性。
📝 摘要(中文)
大型语言模型(LLMs)作为经济主体的应用日益增多,但尚缺乏证据表明LLM代理是否适合参与为人类设计的市场机制,以及这些机制在面对LLM代理时是否能实现预期效果。本文通过复制经典经济实验,将人类受试者替换为LLM代理,置于双重拍卖环境中,检验市场是否能够实现资源的有效配置。研究发现,LLM代理主导的市场在向市场均衡的收敛速度上较慢,资源配置效率低于人类主导的市场。此外,个体交易决策分析显示不同模型家族和市场角色之间存在显著异质性。我们还对代理生成的链式思维(CoT)轨迹进行了词汇分析,发现执行交易的决策与从战略考虑转向紧迫感相关。我们公开发布了测试框架,以供未来评估使用。
🔬 方法详解
问题定义:本文旨在探讨大型语言模型(LLMs)作为经济代理在市场机制中的适应性,现有方法未能有效评估LLM代理在市场中的表现及其对资源配置的影响。
核心思路:通过将经典经济实验中的人类受试者替换为LLM代理,分析其在双重拍卖环境中的行为,以评估其与市场机制的兼容性。
技术框架:研究设计包括实验设置、数据收集和分析三个主要模块。首先,在双重拍卖环境中进行实验,其次收集LLM代理的交易决策数据,最后进行数据分析和结果评估。
关键创新:本文的创新在于首次系统性地评估LLM代理在市场机制中的表现,揭示了其在资源配置效率上的不足,与传统人类市场的显著差异。
关键设计:实验中设置了不同的市场角色和模型家族,采用了链式思维(CoT)分析方法,重点关注交易决策的紧迫性与战略考虑之间的关系。具体参数和损失函数的设置在实验中进行了详细记录。
🖼️ 关键图片
📊 实验亮点
实验结果显示,LLM代理主导的市场在向均衡收敛的速度上显著低于人类主导市场,资源配置效率下降。个体交易决策的异质性表明不同模型在市场中的表现差异,且交易决策的紧迫性影响了执行交易的选择。
🎯 应用场景
该研究为大型语言模型在经济市场中的应用提供了实证基础,具有重要的理论和实践价值。未来,LLM代理可能在自动化交易、市场预测等领域发挥更大作用,同时也为市场机制的设计提供了新的视角。
📄 摘要(原文)
Large language models (LLMs) are increasingly deployed as economic agents, yet there is little evidence whether LLM agents are suited for participating in market mechanisms designed for humans, and whether these mechanisms deliver desired outcomes when faced with LLM agents. We address this question by replicating seminal economic experiments, replacing human subjects with LLM agents. We place agents in a double auction environment, which is a widely-used market mechanism. We check whether such a market is able to deliver an efficient allocation of resources, thereby testing a novel dimension of alignment of LLM agents -- their compatibility with a fundamental market mechanism. We find that markets populated by LLM agents exhibit slower or no convergence towards market equilibrium, thus providing less efficient allocations than markets populated by humans. We then analyze agents' individual trading decisions and find substantial heterogeneity both across model families and market roles. We also run a lexical analysis of Chain-of-Thought (CoT) traces generated by the agents. We find that the decision to execute a trade rather than continue incrementally adjusting prices is associated with a shift from strategic considerations toward urgency. We publicly release our testing framework, which can be used for future evaluations.