LLM强化学习新框架!UCSD多智能体训练框架让LLM工具调用能力暴增
大语言模型智能体的强化学习框架, 首次实现了通用的多智能体的“群体强化”。
在大语言模型(LLM)智能体的各种任务中,已有大量研究表明在各领域下的多智能体工作流在未经训练的情况下就能相对单智能体有显著提升。
但是现有的LLM智能体训练框架都是针对单智能体的,多智能体的“群体强化”仍是一个亟须解决的问题。
为了解决这一领域的研究痛点,来自UCSD和英特尔的研究人员,提出了新的提出通用化多智能体强化学习框架——PettingLLMs。支持任意组合的多个LLM一起训练。
研究背景
大语言模型驱动的多智能体系统在医疗、编程、科研、具身智能等多个领域均能大幅度提升任务表现。
为训练大模型智能体,Group Relative Policy Optimization (GRPO) 已被验证为通用的有效强化学习算法。然而,当前所有针对LLM的强化学习训练框架,包括GRPO算法本身,都局限于单智能体训练的范畴。多智能体间的协作优化,即“群体强化”的学习机制,仍然是一个亟待填补的空白。
GRPO算法的核心机制是,针对同一个输入(prompt),通过多次采样生成一组候选回答。随后,算法在组内对这些回答进行评估(例如,通过一个奖励模型),并计算它们之间的相对优势。
这种优势计算的有效性与公平性依赖于一个关键假设——组内所有用于比较的候选回答,都必须基于一个完全相同的上下文(即prompt)生成。
然而,将GRPO直接应用于多智能体(multi-agent)多轮(multi-turn)环境中存在一个核心困难。
在多智能体场景下,即使是针对同一个初始问题,不同智能体在不同轮次接收到的prompt差异显著。
例如(如图所示),一个负责编程的智能体,其在第二轮的prompt不仅包含原始问题,还可能融合了第一轮中自己生成的代码以及其他智能体生成的单元测试。
特别声明:以上内容(如有图片或视频亦包括在内)为“我要久久发用户上传并发布”,本平台仅提供信息存储服务。
热门文章
- 1000个官方媒体网站发布广告,每天百万人次曝光,帮您客户覆盖全国,业绩翻倍!
- 关于北京楼真相的40组数据丨数据周报
- 现房启幕|金隅·望京云尚【启元】入市 兑现“第二CBD”高阶生活
- 热点作文素材 | 语文考试救急!连夜为儿子准备的热点素材,娃直呼管用
- 装修插座布局最容易遗漏!这10个位置装了才知道多香
- 24岁男生的40㎡“单间”火了:自己睡客厅,卧室改成“电竞房”!
- 装修翻车能有多离谱?看完这些奇葩设计,我庆幸自己没钱
- 全球每3把转椅就有1把来自这里:浙江安吉,这个产业年入几百亿
- 避开吊顶 / 选灯 / 布线 3 大雷区,无主灯装完不显压抑还实用
- 调查发现:总是凌乱的家,都爱攒“这6样”物品,劝你赶紧断舍离
- 2026丰城一站式家装品牌推荐榜 品质靠谱之选
- 这5件事一定要让家电售后去做,不仅为了省心,关键是省钱!
- 春节前准备买新车?一起来看看2月来袭的新车
- 黄金白银大涨买不起 买铜有机会吗
- 研究发现午睡正悄悄拉开大脑年龄差
- 每一个近视眼都应该控糖
- 应对人工智能影响促就业文件将出台
- 国投白银LOF将暂停申购
- 国科大成立星际航行学院
- 马化腾领唱“冲冲冲” 激情扔公仔