您的位置:首页 > 互联网

Llama 8B搜索100次超越GPT-4o!推理+搜索即可提升性能,新Scaling Law诞生?

发布时间:2024-08-15 20:37:39  来源:互联网     背景:

声明:本文来自于微信公众号新智元,作者:新智元,授权转载发布。

【新智元导读】最近的论文表明,LLM等生成模型可以通过搜索来扩展,并实现非常显著的性能提升。另一个复现实验也发现,让参数量仅8B的Llama3.1模型搜索100次,即可在Python代码生成任务上达到GPT-4o同等水平。

强化学习先驱、加拿大阿尔伯塔大学CS系教授Rich Sutton曾在2019年写下一篇名为《The Bitter Lesson》的博文,成为AI领域的经典论述之一。

甚至,Rich Sutton在字里行间体现出的直觉已经颇有Scaling Law的意味。

原文地址:https://www.cs.utexas.edu/~eunsol/courses/data/bitter_lesson.pdf

文章简要回顾了AI在象棋、围棋、语音识别和视觉等领域的发展道路,并提出了这样的观点:

我们应该吸取的惨痛教训之一,就是要意识到通用方法的力量。随着可用算力猛增带来计算量的增加,这种方法可以持续扩展。似乎能以这种方式进行任意扩展的两种方法正是搜索(search)和学习(learning)。

然而,这个观点和Scaling Law并不完全一样,我们也不能以此为据,认为小型模型注定无关紧要。

正如Sutton所描述的,扩展这条路上我们有两板斧:学习和搜索。

OpenAI提出的Scaling Law更强调前者。在其他条件不变时,较大的模型表现更好,因为可以从训练集中学习到更多知识和模式。

但我们往往忽略的是后者。搜索方法也可以在推理阶段随算力增长进行平滑的扩展,以生成更多或者更高质量的候选答案。

斯坦福、牛津、DeepMind等机构的学者最近发表的一篇文章就关注到了这一点。

论文地址:https://arxiv.org/abs/2407.21787

随着推理阶段重复采样数量的提升,模型在GSM8K、MATH、MiniF2F-Math、SWE-bench Lite等数学、推理、代码领域的性能(即问题覆盖率)都有显著提升。

甚至,二者之间似乎存在指数线性关系,并可以用指数幂律建模,似乎能说明推理阶段缩放定律的存在。

受到这篇论文的启发,两位工程师开始尝试复现——结果是,用100个小Llama模型进行搜索,即可在Python编程任务中追赶甚至打败GPT-4o。

两位作者用了一个形象的比喻:以前,需要一匹马大小的鸭子才能获得边界能力;但现在,我们可以选择用100只鸭子大小的马(或者更确切地说,是羊驼Llama)。

实验所用的源代码已上传至GitHub,而且复现成本相当低。

https://gist.github.com/charlesfrye/27f25188dbbcfdf20a83c0230020fe05

为了尝试较高性能,作者使用了vLLM库实现批量推理,并将硬件条件扩展到10个A100-40GB GPU,输出速度达到40k token/s。

评估指标和结果

作者选择了上述的Large Language Monkeys论文中未涵盖的基准测试——HumanEval。

这个数据集的好处在于,使用运行测试对生成的代码进行评估,而不需要LLM-as-Judge或人类评估的参与,能更加客观地衡量其正确性。

模型的性能通过pass@k和fail@k两个指标衡量。根据PapersWithCode的报告结果,在零样本推理时,GPT-4o的pass@1成绩为90.2%。

https://paperswithcode.com/sota/code-generation-on-humaneval

使用上述论文提出的方法,加上最少量的prompt微调(未调整其他超参数),Llama3.18B的pass@k分数就有显著提升。

重复采样数k为100时,性能与GPT-4o相当(90.5% vs.90.2%);k达到1000时,分数为95.1%,明显优于GPT-4o。

天猫双十一会场

如果使用fail@k指标(相当于1-pass@k),再将上图中的两个坐标轴进行对数变换,就可以看到下图所示的曲线,似乎完美符合缩放定律。

值得注意的是,这个小实验并不是对论文的严格复现,仅是提取了其中的核心方法。

然而,这些结果更加强调了,使用搜索方法进行推理阶段增强时,较小的模型能以可预测的方式胜过GPT-4o这样的巨无霸模型。

搜索的未来

搜索方法之所以强大,正是因为它能随着计算量的增加进行透明的扩展,还可以将资源消耗从内存转移至计算,实现进一步的资源平衡。

最近AI在数学方面的重大成果,比如DeepMind的AlphaProof和AlphaGeometry取得了IMO银牌的水平,以及得到验证的忙碌海狸问题,都离不开其中使用的搜索。

然而,搜索的实现首先需要对结果进行高质量的评估。DeepMind的模型将自然语言表述的数学问题翻译为形式化表述,从而得到Lean这种编译器/验证器的详细监督。

陶哲轩也曾在采访中不断强调,形式化对AI在数学领域的应用十分重要,可以使并行程度和自动化程度大大提高。

根据Curry-Howard-Lambek对应关系,对数学证明和代码生成结果而言,使用计算机程序进行自动化识别和评估会相对容易。

Linux sysctl

但类似的方法可能会在数学和编程以外的领域失效。比如,对于总结电子邮件这类开放式的NLP任务,就很难进行有效的搜索。

从这个角度来看,搜索是评估的下游。我们可以粗略地预期,生成模型在特定领域中的性能提升,将和评估、搜索能力成正比。

为达到这个目的,可重复数字环境中的agent似乎是一个有前景的方向。

参考资料:

epic送装机模拟器

https://modal.com/blog/llama-human-eval


返回网站首页

本文评论
赵明谈荣耀MagicOS信息安全:排在所有应用前面 用户自主选择授权
快科技5月28日消息,荣耀200系列昨晚正式发布,在人像摄影方面具有出色表现,发布会后荣耀CEO赵明接受了媒体采访。赵明回答了有关荣耀MagicOS信息安全问题,以及荣耀通过什么技术做...
日期:05-28
BOSS直聘《2021应届生秋招早鸟报告》 计算机软件行业博士生平均月薪达41709元
9月17日消息,金九银十,又到了秋招的季节,根据BOSS直聘研究院发布的《2021应届生秋招早鸟报告》显示,自7月以来,各大企业的博士招聘需求同比激增71.5%。据了解,近几年,科技企业与学...
日期:08-01
取代进口 我国自研第四代核电管理系统已全面应用
在核电领域,我国又实现了一个重要突破,事关核电安全的核电管理系统结束了依靠进口的日子,已经在两座核电厂应用。人形机器人 特斯拉索尼ps5深度测评据新华社、中核武汉消息,由中...
日期:06-03
neo58+128「Neo8超大存储版上架 16GB+1TB版本_iQOO」
来源:中关村在线iphone 14天退换originos第一批内测10月20日,iQOO Neo8手机的超大存储版在京东平台上架。这款手机是iQOO Neo8/Pro系列的一部分,于今年5月发布时,最高存储配置为...
日期:10-22
宝马车买什么保险公司「宝马卖保险,到底为了啥?」
  在保险行业“去中介化”的呼声中,近年来有上千家保险中介机构被注销。但在这种情况下,依然有新玩家入场。日前,“宝马也要卖保险”的消息一出,瞬间引起行业关注。其实此前,包...
日期:09-27
周鸿祎免费课后自传销量攀升,《超越好奇》荣膺“登峰奖”_周鸿祎出书
【编者按】近日,第三届“登峰传记图书奖”揭晓,周鸿祎自传《超越好奇》一书凭借生动的创业实践故事和独特的商业洞见,荣获“十大中国商业传记好书”称号。该书自上市以来广受好...
日期:03-08
与新CEO共同领导安全团队-马斯克重组X,只负责产品与工程团队_马斯克的新公司
8 月 1 日消息,美国当地时间周一,社交媒体 X 公司(前身为推特)宣布,公司刚刚进行了一次重组。埃隆・马斯克 (Elon Musk) 作为 X 的所有者,与首席执行官琳达・亚卡里诺 (Linda Yacc...
日期:09-19
实景自动直播系统2.0重磅升级,搭建属于自己的全平台自动直播系统!
什么是实景自动直播系统?实景自动直播系统,是一款操作简单,帮助商家实现低成本、常态化、自动直播的直播神器,它不需要电脑,只需一、两台手机就能实现实景自动直播!除了自动讲解...
日期:04-12
两度被骂上热搜,DR钻戒“真爱”营销难再续「dr钻戒新闻」
被各种商家营销套路侵害权益?买到的商品出故障投诉无门? 黑猫投诉平台全天候帮您解决消费难题【消费遇纠纷,就上黑猫投诉】   文 / 梁又匀  责编 /;高梦阳  编辑;/;梁又...
日期:10-02
华为在东北建厂华为在东北投资量子安全领域_华为东北分公司
来源:中关村在线自上市伊始,吉大正元便开始在量子计算及抗量子密码技术领域进行积极的探索,并创新性地提出了“AI+密码+芯片”的技术基础架构。随着时间的推移,公司已成功从一家...
日期:06-05
甲骨文今年将斥资数十亿美元买GPU发力AI云服务,英伟达赚翻了
6 月 29 日消息,据路透社报道,甲骨文 Oracle 创始人兼董事长 Larry Ellison 周三表示,甲骨文公司正在花费“数十亿美元”购买英伟达公司的芯片,以扩展针对新一波 AI 人工智能浪...
日期:09-22
理想和小鹏,被自家新车坑惨了_理想汽车与小鹏汽车
出品 | 虎嗅汽车组作者 | 王笑渔编辑 | 周到头图 | 视觉中国刚刚过去的8月,大家都在往前奔跑,却只有理想和小鹏突然摔倒。9月1日,造车新势力相继交出8月的交付量成绩单。主打中...
日期:09-16
堪比ChatGPT!Meta华人提出「牧羊人」Shepherd,LLaMA 70亿参数微调,评估模型生成给出建议
新智元报道编辑:桃子【新智元导读】大模型生成内容还需自我改进。Meta提出的Shepherd模型,能够评估模型生成,给出建议。近日,Meta AI最新研究,提出了语言模型Shepherd,专门用于评...
日期:08-15
外媒:英国已开始制定计划将华为5G设备清零_英国拆除华为5g
  5月23日消息 据英国《每日电讯报》报道,英国首相鲍里斯·约翰逊已计划在新冠肺炎疫情结束之后减少华为对英国5G网络的参与程度。   报道称,鲍里斯·约翰逊已让政府官...
日期:07-14
东方甄选后院起火带火高途 “小作文”风波让对手捡了便宜
近期,东方甄选卷入了一场“小作文”风波,起因是有关公司文案天花板级别的真实创作者引发的争议。此次争端使公司形象受到冲击,粉丝和公司展开博弈。在争论中,东方甄选CEO孙东旭...
日期:12-13
国内首艘多功能运维母船交付:总长98米、载缆量约2500吨_航母运输船
快科技6月19日消息,据媒体报道,中国船舶集团第七〇八研究所精心研发设计的多功能运维母船丰华23”号,已由福建船政旗下的东南造船有限公司成功建造并交付使用。丰华23”号不仅...
日期:06-20
捐出大部分财富!OpenAI CEO奥特曼格局拉满:至少140亿元_奥特曼基金会官网
快科技5月29日消息,据国外媒体报道,OpenAI首席执行官萨姆奥特曼及其丈夫奥利弗穆尔赫林宣布加入捐赠誓言,承诺捐出他们的大部分财富。奥特曼的身价至少为20亿美元(约合人民币144...
日期:05-29
腾讯最近新出了什么「腾讯旧牌新发」
声明:本文来自微信公众号“新莓daybreak”(ID:new-daybreak),作者:李欢,3,授权转载发布。商业竞争中,入局早晚从来不是预测成功的准则。那些占据主流地位的核心产品,往往不是最先出...
日期:01-04
AI作文检测技术如何工作?人工智能原创作文内容相关性分析工作原理
什么是 AI作文检测?AI作文检测是一种利用人工智能技术来分析和评估学生作文质量的工具。它可以帮助教师快速识别作文中的语法错误、拼写错误、句式结构问题以及内容的相关性...
日期:06-15
男女配合当街开井盖用勺挖地沟油被网友拍下引围观:行为太恶劣 应严惩
近日,黑龙江哈尔滨一男子和朋友在中央大街散步后往回走,看到一名男子头戴大灯,翻起下水道井盖。而她旁边还有一女子和他打配合,推了一个大桶子。目击者观察了一会发现2人每个井...
日期:04-10