Grok 4.1霸榜第一第二,马斯克新模型怎么做到的?

admin AI新闻 16

梦晨 发自 凹非寺

量子位 | 公众号 QbitAI

刚刚, 马斯克发布了Grok 4.1, 与此同时, Grok就在大模型竞技场里,占据了第一, 还占据了第二的位置, 霸榜了。

怎么做到的?

Grok 4.1霸榜第一第二,马斯克新模型怎么做到的?-第1张图片-世界杯直播-世界杯直播观看-官方最新链接-V3.6.9

Grok 4.1的那种思考程式凭借1483的Elo分数稳稳占据榜首位置, 它比非xAI模型里的最高分整整领先了31分。

有着1465分的Grok 4.1非思考模式, 拿到了第二名, 它超越了公开排行榜上, 所有不同的这类模型的完整推理模式。

Grok 4.1霸榜第一第二,马斯克新模型怎么做到的?-第2张图片-世界杯直播-世界杯直播观看-官方最新链接-V3.6.9

曾有的Grok 4于排行榜之上仅仅位列第33位, 在不足半年的时长里, xAI达成了巨大的跨越。

在大模型竞技场新推出的权威榜单里, 有分为专家榜以及职业榜这两种榜单的情况, Grok 4.1的思考模式, 在这两种榜单当中, 均处于占据榜首位置的状况。

Grok 4.1霸榜第一第二,马斯克新模型怎么做到的?-第3张图片-世界杯直播-世界杯直播观看-官方最新链接-V3.6.9

专家榜里头的题目, 预估唯有各个领域的顶尖专家才会予以提出, 职业榜划分成八个细分。

软件, 以及 IT 服务, 写作, 还有文学与语言, 生命科学, 加上物理科学和社会科学, 娱乐, 以及体育和媒体, 商业, 包括管理和财务运营, 数学, 又有法律与政府, 医疗保健。

Grok4.1, 在目前的情况下, 就文学榜而言, 仅仅是输给了Gemini2.5, 于数学榜, 则是输给了Claude4.5以及o3, 然而, 在其他六个榜单那里, 它都成功拿下了第一。

Grok 4.1霸榜第一第二,马斯克新模型怎么做到的?-第4张图片-世界杯直播-世界杯直播观看-官方最新链接-V3.6.9

然而呢, 因模型才推出, 票数尚稀少, 待“Preliminary”标识不见(达一定票数)时的成果更具参考意义。

于并非用户投票的EQ - Bench情商测试里头, Grok 4.1有着同样出色的表现, 它超过了刚发布没多久的Kimi K2(不是其所指的Thinking版本)。

EQ - Bench是一项测试, 是由大语言模型来进行评判的, 它用于评估主动情商能力, 还用于评估理解力, 也用于评估洞察力, 同时用于评估同理心, 以及用于评估人际交往技能。

Grok 4.1霸榜第一第二,马斯克新模型怎么做到的?-第5张图片-世界杯直播-世界杯直播观看-官方最新链接-V3.6.9

将RLHF推向前所未有的高度

Grok 4.1原来早就暗中测试了。

从11月1日起始, 新版模型朝着越来越多的用户逐步推送, 在此期间持续开展盲测对比评估, 结果显示64.78%的用户对新版更为青睐。

Grok 4.1霸榜第一第二,马斯克新模型怎么做到的?-第6张图片-世界杯直播-世界杯直播观看-官方最新链接-V3.6.9

xAI的官方网站, 给出了Grok4.1跟从前版本, 在各个不同方面的回答比较。

响应情感问题:

Grok 4.1霸榜第一第二,马斯克新模型怎么做到的?-第7张图片-世界杯直播-世界杯直播观看-官方最新链接-V3.6.9

创意写作:

Grok 4.1霸榜第一第二,马斯克新模型怎么做到的?-第8张图片-世界杯直播-世界杯直播观看-官方最新链接-V3.6.9

在技术报告当中, xAI着重特别指出, Grok 4.1于创造性方面, 带来了显著改进, 在情感性方面, 带来了显著改进, 在协作性互动方面, 同样带来了显著改进。该模型变得愈发善于捕捉细微的意图, 对话变得更具吸引力, 个性表现变得更加连贯, 并且, 完全保留了前代产品敏锐智能的同时, 还保留了其可靠性。

为达成这些提升, 团队动用了支撑Grok 4的大规模强化学习基础设施, 把该基础设施用于优化模型的风格, 用于优化模型的个性, 用于优化模型的有用性, 用于优化模型的对齐性。他们所开发的新方法使得前沿智能推理模型作为奖励模型, 该前沿智能推理模型能够自主评估响应, 该前沿智能推理模型能够自主迭代响应。

负责后训练的Dust Tran, 由xAI承担此项工作, 其分享了更多方面的细节, 重点在于强化学习这一领域, 把RLHF这一概念提升到了前所未有的高度。

过去几个月中, 我们团队由十几人构成, 利用用户于真实对话里的偏好, 还有基于强大推理能力用以评分的智能体奖励模型, 对强化学习即以 RL 表示的算法展开了全面改进。

另外, 我们把RL的规模予以扩大, 使其增大了一个数量级, 这一规模远远超过了Grok 4里现有的同类型预训练的规模。

在Grok 4.1里, 针对那种并不需要思维链推理的快速回复模式, 进行了特别的加强处理。当把推理功能关闭之后, 输出的标记数从大概2300个, 减少到了850个。

此外Grok 4.1还重点改善了幻觉问题。

具有搜索工具配备的非推理类模型, 能够迅速地给出答案, 然而处于推理的深度受到限制, 以及工具调用的预算存在限定的状况下, 极易出现事实方面的错误。

处于Grok 4.1进行之后的训练这个阶段时, 是着重于去减少在信息检索提示里所出现的事实性幻觉的。而后便观察到了这样的情况, 那就是针对于抽样生成的那些信息检索提示而言, 幻觉发生的比率出现了显著的降低。

在堪称包含500个个人传记问的FActScore测试里面, Grok 4.1的非推理模式所取得的成绩, 相较于前一代而言, 也呈现出显著的改进态势。

Grok 4.1霸榜第一第二,马斯克新模型怎么做到的?-第9张图片-世界杯直播-世界杯直播观看-官方最新链接-V3.6.9

面对更多示例, Grok 4.1, 能够将图文并茂的回答予以输出, 这一点被展示了出来。

Grok 4.1霸榜第一第二,马斯克新模型怎么做到的?-第10张图片-世界杯直播-世界杯直播观看-官方最新链接-V3.6.9

现在, Grok 4.1已在grok.com、X平台及iOS和Android应用上, 面向全部用户予以开放, 是以自动模式默认进行推出的, 并且用户能够在模型选择器里明确地选择Grok 4.1。

参考链接:

https://x.ai/news/grok-4-1

https://x.com/arena/status/1990530984014676155

https://x.com/dustinvtran/status/1990532663258853720

标签: Grok4.1 马斯克 大模型 AI技术 排行榜

发布评论 0条评论)

还木有评论哦,快来抢沙发吧~