Meta开源模型遭质疑:刷榜作弊被揭露,基准测试排名暴跌引热议

2周前 科技 7观看
摘要 随着人工智能技术的飞速发展,开源大模型在自然语言处理领域的应用越来越广泛。近期,Meta发布的最新开源大模型Llama-4-Maverick在Chatbot Arena LLM排行榜中的排名一路飙升,一度位居第二。然而,近期的一系列

随着人工智能技术的飞速发展,开源大模型在自然语言处理领域的应用越来越广泛。近期,Meta发布的最新开源大模型Llama-4-Maverick在Chatbot Arena LLM排行榜中的排名一路飙升,一度位居第二。然而,近期的一系列事件引发了开发者对Meta刷榜作弊的质疑,导致其排名直线下降。
o1Z喜好网-记录每日喜好的科技时尚娱乐生活

首先,让我们回顾一下Llama-4-Maverick的基本情况。该模型是Meta推出的最新大模型之一,包含Scout、Maverick和Behemoth三个版本。其中,Llama-4-Maverick在LMArena公布的Chatbot Arena LLM排行榜中排名第二,仅次于Gemini 2.5 Pro。这一表现引起了广大开发者的关注和期待。o1Z喜好网-记录每日喜好的科技时尚娱乐生活

然而,随着开发者实际使用Llama-4-Maverick开源版的效果陆续曝光,质疑声也随之而来。有开发者发现,Meta提供给LMArena的Llama-4-Maverick版本与提交给社区的开源版本不同。这引发了开发者对Meta刷榜作弊的质疑,导致其口碑急转直下。o1Z喜好网-记录每日喜好的科技时尚娱乐生活

面对这一质疑,Chatbot Arena官方发文确认了用户的担忧,并考虑更新排行榜。经过调查,他们发现Meta首次提交给LMArena的Llama-4-Maverick-03-26-Experimental是一个实验性聊天优化版本,当时该版本的排名为第二。修正后的模型为HuggingFace开源版同款Llama-4-Maverick-17B-128E-Instruct,是17B激活参数、128个MoE专家的指令微调模型。目前,该模型在LMArena的排名为32名,远低于其他模型。o1Z喜好网-记录每日喜好的科技时尚娱乐生活

那么,为什么Meta的Llama-4-Maverick表现不佳呢?Meta的一位发言人在回应TechCrunch的采访时表示,该模型是“针对对话性进行优化”的。这些优化在LM Arena上取得了不错的效果,因为LM Arena的人类评分者会选择他们更偏好的结果。然而,在基准测试中,LM Arena的可靠性一直备受争议,因为它并不能完全反映模型在实际应用中的表现。o1Z喜好网-记录每日喜好的科技时尚娱乐生活

值得注意的是,Meta已经开始重视这个问题。他们已经发布了开源版本,并表示将期待开发者的反馈和定制化建议。这种开放的态度值得赞赏,因为通过与开发者紧密合作,Meta可以不断优化模型,提高其在不同场景下的表现。o1Z喜好网-记录每日喜好的科技时尚娱乐生活

o1Z喜好网-记录每日喜好的科技时尚娱乐生活

o1Z喜好网-记录每日喜好的科技时尚娱乐生活

展开全文
猜你感兴趣
疑遭猎杀 泰海域发现无头“美人鱼”:只因毫无科学依据的传说

疑遭猎杀 泰海域发现无头“美人

11月19日

11-19 57阅读
小米手机快速占领高端:4000-6000元份额大涨

小米手机快速占领高端:4000-6000

11月18日

11-19 65阅读
‌OPPO Reno13系列及IoT生态新品发布会定于11月25日

‌OPPO Reno13系列及IoT生态新品

11-19 61阅读
中银300亿母基金加速推进

中银300亿母基金加速推进

银行

11-19 65阅读
叮咚买菜上岸、巨头加码火拼,前置仓大战重启

叮咚买菜上岸、巨头加码火拼,前置

近年

11-19 62阅读
消失三年的李子柒,要跟全网“唱反调”!

消失三年的李子柒,要跟全网

11-19 62阅读
泰妍将在今天(18日)下午6点发布迷你六辑《Letter To Myself》

泰妍将在今天(18日)下午6

凭借《To. X》创造热潮的少

11-19 62阅读
综艺《开播!短剧季》试镜最后一役!谁能夺得《包拯与公孙策》IP试播资格?

综艺《开播!短剧季》试镜最

  国内首档“微短剧+综艺”创新真人

11-19 64阅读
浪胃仙IP创始人“游絮”犯职务侵占罪被判8年:罚100万 归还账号

浪胃仙IP创始人“游絮”犯

11月13日消息,据

11-19 60阅读
三傻变劳拉

三傻变劳拉

跨度太大,玩家一

11-19 57阅读
PS5 Pro在美国的首发销量与PS4 Pro相近

PS5 Pro在美国的首发销量

PS5 Pro 于本月早些时候发行,虽然这款

11-19 62阅读
新斗罗大陆兑换码,2024新斗罗大陆礼包兑换码

新斗罗大陆兑换码,2024新

新斗罗大陆是一款十分好玩的手游,如果你

11-19 64阅读
奥特曼格斗进化0怎么获得奥特之父?奥特曼格斗进化0解锁奥父教程

奥特曼格斗进化0怎么获得

《奥特曼格斗进化0》游戏中玩家可以操

11-19 112阅读
功耗低+性能强 双十一AMD锐龙9000处理器省钱游戏套装推荐

功耗低+性能强 双十一AMD

11-19 57阅读
饥荒宠物洞召唤宠物所需物品一览

饥荒宠物洞召唤宠物所需物

宠物洞是饥荒游戏里面的一个特殊场景,在

11-19 64阅读