跳到正文
原文
arXiv: LLM marketing / consumer· Shuze Daniel Liu·· 6 天前AI 评分8

用强化学习训练 LLM 智能体在多产品市场中做销售

Learning to Sell: Reinforcement Learning for Strategic Large Language Model Agents in Multi-Product Markets

AI 导读

研究者提出用可验证奖励强化学习(RLVR)训练 LLM 智能体,使其在多产品议价环境中充当卖家,在信息不对称和沟通轮次受限下动态匹配买家与最有利可图的商品。该框架将问题形式化为部分可观测马尔可夫决策过程,并采用四段式消息协议把自然语言映射为可解析的决策空间。

来源:arXiv: LLM marketing / consumer · arxiv.org