研究发现:训练大语言模型进行推理任务并不需要海量数据

6个月前 科技 30观看
摘要 上海交通大学的研究人员在一项新研究中发现,大语言模型 (LLMs) 无需依赖大规模数据集就能学习复杂的推理任务。他们的研究表明,只需要一小批精心策划的示例,就能训练大语言模型完成那些原本被认

上海交通大学的研究人员在一项新研究中发现,大语言模型 (LLMs) 无需依赖大规模数据集就能学习复杂的推理任务。他们的研究表明,只需要一小批精心策划的示例,就能训练大语言模型完成那些原本被认为需要数万个训练实例的任务。1Wp喜好网-记录每日喜好的科技时尚娱乐生活

这种效率得益于现代大语言模型在预训练阶段获得的固有知识。随着新的训练方法在数据和计算效率方面不断提升,企业可能无需依赖大型 AI 实验室的资源,就能创建定制化模型。1Wp喜好网-记录每日喜好的科技时尚娱乐生活

少即是多 (LIMO)1Wp喜好网-记录每日喜好的科技时尚娱乐生活

在这项研究中,研究人员对"训练大语言模型进行推理任务需要大量数据"这一假设提出了质疑。他们提出了"少即是多" (LIMO) 的概念。这项工作建立在之前的研究基础之上,即大语言模型可以通过少量示例与人类偏好保持一致。1Wp喜好网-记录每日喜好的科技时尚娱乐生活

在他们的实验中,他们证明可以使用几百个训练示例为复杂的数学推理任务创建 LIMO 数据集。在该数据集上微调的大语言模型能够创建复杂的思维链 (CoT) 推理链,使其能够以很高的成功率完成任务。1Wp喜好网-记录每日喜好的科技时尚娱乐生活

例如,基于 LIMO 选择的 817 个训练示例进行微调的 Qwen2.5-32B-Instruct 模型在极具挑战性的 AIME 基准测试中达到了 57.1% 的准确率,在 MATH 测试中达到了 94.8% 的准确率,超过了使用百倍训练数据的模型。它在基准测试中的得分也高于 QwQ-32B-Preview (经过推理训练的 Qwen 模型版本) 和 OpenAI o1-preview 等推理模型,而这些模型都使用了更多的数据和计算资源进行训练。1Wp喜好网-记录每日喜好的科技时尚娱乐生活

此外,LIMO 训练的模型能够泛化到与训练数据有很大差异的示例。例如,在 OlympiadBench 科学基准测试中,LIMO 模型超过了 QwQ-32B-Preview,在具有挑战性的 GPQA 基准测试中,它达到了 66.7% 的准确率,接近 OpenAI-o1-preview 73.3% 的领先得分。1Wp喜好网-记录每日喜好的科技时尚娱乐生活

对企业 AI 的意义1Wp喜好网-记录每日喜好的科技时尚娱乐生活

定制化大语言模型是企业应用的一个很有吸引力的用例。借助检索增强生成 (RAG) 和上下文学习等技术,大语言模型可以在无需昂贵微调的情况下,使用定制数据或执行新任务。1Wp喜好网-记录每日喜好的科技时尚娱乐生活

然而,推理任务通常需要训练和微调大语言模型。普遍认为此类任务需要大量包含详细推理链和解决方案的训练示例。对许多应用和公司而言,创建这样的数据集既耗时又不切实际。1Wp喜好网-记录每日喜好的科技时尚娱乐生活

最近,研究人员展示了纯强化学习方法可以使模型通过生成多个解决方案并选择最佳方案来自行训练推理任务。虽然这种方法需要较少的人工干预,但仍然需要许多企业无法负担的昂贵计算资源。1Wp喜好网-记录每日喜好的科技时尚娱乐生活

相比之下,制作几百个示例是许多公司都能应对的任务,这使得专门的推理模型能够被更多的组织所使用。1Wp喜好网-记录每日喜好的科技时尚娱乐生活

研究人员写道:"这一发现对人工智能研究具有深远影响:它表明即使是竞赛级别的复杂推理能力也可以通过最少但精心策划的训练样本有效地激发出来。"1Wp喜好网-记录每日喜好的科技时尚娱乐生活

LIMO 为何有效1Wp喜好网-记录每日喜好的科技时尚娱乐生活

在实验中,研究人员发现大语言模型能够用较少示例学习复杂推理任务的两个关键原因。1Wp喜好网-记录每日喜好的科技时尚娱乐生活

首先,最先进的基础模型在预训练期间已经接触了大量的数学内容和代码。这意味着这些大语言模型的参数中已经包含了丰富的推理知识,可以通过精心设计的示例激活。1Wp喜好网-记录每日喜好的科技时尚娱乐生活

其次,新的后训练技术表明,允许模型生成延伸推理链能显著提高其推理能力。本质上,给模型更多"思考"时间使其能够更有效地解析和应用预训练知识。1Wp喜好网-记录每日喜好的科技时尚娱乐生活

研究人员写道:"我们推测,成功的推理源于两个因素的协同作用:丰富的预训练知识和推理时足够的计算资源。这些发展共同表明了一个惊人的可能性:如果模型拥有丰富的推理知识并且有足够的计算空间,那么激活它们的推理能力可能只需要少量鼓励深入思考的高质量训练样本,而不是大规模的微调数据集。"1Wp喜好网-记录每日喜好的科技时尚娱乐生活

根据研究人员的发现,创建有用的 LIMO 数据集的关键在于选择合适的问题和解决方案。数据管理者应该优先考虑需要复杂推理链、多样化思维过程和知识整合的具有挑战性的问题。这些问题还应该偏离模型的训练分布,以鼓励新的推理方法并促使其实现泛化。1Wp喜好网-记录每日喜好的科技时尚娱乐生活

相应地,解决方案应该清晰且组织良好,推理步骤要适应问题的复杂性。高质量的解决方案还应该通过精心构建的解释,逐步建立理解,提供战略性的教育支持。1Wp喜好网-记录每日喜好的科技时尚娱乐生活

研究人员写道:"通过专注于最少但精心策划的推理链集合,我们体现了 LIMO 的核心原则:高质量的示范,而不是纯粹的数据量,是释放复杂推理能力的关键。"1Wp喜好网-记录每日喜好的科技时尚娱乐生活

研究人员已经发布了他们实验中用于训练 LIMO 模型的代码和数据。未来,他们计划将这一概念扩展到其他领域和应用。1Wp喜好网-记录每日喜好的科技时尚娱乐生活

展开全文
猜你感兴趣
问界理想的新擂台:问界M8 VS 理想L8

问界理想的新擂台:问界M8 VS 理想

要说近年来什么行业最“卷”,相信

11-19 107阅读
‌OPPO Reno13系列及IoT生态新品发布会定于11月25日

‌OPPO Reno13系列及IoT生态新品

11-19 120阅读
贝恩投资宣布完成全球特殊机会基金的超额认购

贝恩投资宣布完成全球特殊机会基

贝恩

11-19 119阅读
高端餐饮的苦日子还在后头

高端餐饮的苦日子还在后头

近日,

11-19 130阅读
一单只挣几块钱,年轻人追捧的代炒是门好生意吗?

一单只挣几块钱,年轻人追捧的代炒

杭州

11-19 126阅读
中国电影家协会联合灯塔研究院发布《2024中国电影观众变化趋势报告》

中国电影家协会联合灯塔研

11月15日消息,11月15日,2024年中国金鸡百

11-19 107阅读
百部青少年教育公益微电影《星光好少年之少年王维》开机仪式在北京顺利举行

百部青少年教育公益微电影

  2024年11月9日,由泰安东升公益慈

11-19 104阅读
44岁董洁:曾是无数人的“白月光”,却陷入中年尴尬

44岁董洁:曾是无数人的“白

董洁,她曾经是无数人心中的白月光,但也

11-19 109阅读
李子柒被质疑漆器做假,发出过敏照片力证,全身红肿成“电视机”

李子柒被质疑漆器做假,发出

2024年11月12日停更长达三年的李子柒

11-19 128阅读
飞行员徐枫灿便装吃饭被认出求合影!邻家妹妹穿军装又美又飒

飞行员徐枫灿便装吃饭被认

17日,第十五届中国航展在珠海闭幕。上

11-19 134阅读
《如龙8外传 夏威夷海盗》演员采访视频:谷田步篇

《如龙8外传 夏威夷海盗》

世嘉公开了《人中之龙8外传Pirates in

11-19 126阅读
碧蓝航线ios反和谐教程_碧蓝航线ios反和谐2024

碧蓝航线ios反和谐教程_碧

碧蓝航线ios反和谐怎么弄?相信很多苹果

11-19 148阅读
原子之心展览园啁啾表位置_展览园所有啁啾表所在位置一览

原子之心展览园啁啾表位置

啁啾表是原子之心游戏里面的一个特殊收

11-19 135阅读
原子之心展览园地下区域死者位置介绍

原子之心展览园地下区域死

原子之心游戏里面玩家可以与所有死者对

11-19 126阅读
饥荒理智怎么恢复?饥荒超全恢复理智值方法一览

饥荒理智怎么恢复?饥荒超

饥荒理智怎么恢复?在饥荒游戏的设定中,玩

11-19 132阅读