机器之心报道
机器之心编辑部
在几乎没有任何预先征兆的情况下, 马斯克所创办的人工智能公司xAI, 发布了其最新的模型Grok 4.1。
就在刚才那会儿, xAI宣告, Grok 4.1已然面向全部用户放开, 能够于Grok官网、X以及iOS和Android应用里予以运用。

Grok 4.1会马上于Auto模式里推送, 并且能够在模型选择器那儿手动去选择。

这次, Grok 4.1会在真实世界可用性层面带来显著的提高, 特别是在创造力、情感互动以及协作交互这些方面展现得很突出, 这个GroK 4.1对于细微意图的感知能力更为强大, 跟用户对话更能吸引他人, 整体人格也更具连贯性, 并且完全保留了前代模型强大的智能以及可靠性。

马斯克在 x 上宣传一波自家模型。
于实现这些提升而言, xAI 在支撑 Grok 4 的那同一套大规模强化学习基础设施之上,进一步对模型的风格、个性、助人性以及对齐性予以了优化。并且, 为了对这些不可直接验证的奖励信号加以优化, xAI 开发出了全新的方法, 该方法能够借助前沿的智能体式推理模型当作奖励模型, 进而可以进行大规模自主评估并迭代输出结果。
跟在此之前的线上生产模型相比较而言, Grok 4.1 在进行对比评估期间, 有着百分之六十四点七八的概率, 会被用户以偏好的方式选择。

接下来看 Grok 4.1 的能力特征。
SOTA 通用能力
Grok 4.1 在盲测的人类偏好评估中树立了全新的标杆。
Text Arena排行榜, 于LMArena之上, Grok 4.1的推理模式, 其代号为quasarflux, 以1483的Elo分数, 在总榜上位居首位, 领先最高的非xAI模型, 整整31分。
Grok 4.1的那种非推理模式, 它有个代号叫tensor, 这个模式, 能够在不使用思维token的情况下, 做到即时响应, 然后, 它在排行榜上处在第二的位置, 有着1465 Elo的分数。就算不启用推理, Grok 4.1它, 也超过了其他所有模型在启用完整推理配置时所呈现出来的表现。
相比起来, Grok 4以及它之前的总排名, 你知晓吗, 仅仅为第33名, 然而Grok 4.1的整体表现, 却实现了大幅超越这之前的Grok 4其表现的情况。

情感智能
要对模型于个性以及人际互动能力层面的进展予以评估, xAI针对Grok 4.1在EQ - Bench3上展开了测试。
EQ - Bench 是一项测试, 它由大语言模型进行评判, 旨在评估主动情绪智能, 这其中涵盖情绪理解、洞察力、同理心以及人际交往技能。该测试集含有 45 个具有挑战性的角色扮演场景, 多数场景由预先编写的三轮对话提示构成。此基准借助多项标准验证模型的回答质量, 以此来评估模型表现。另外, 它运用成对对比的办法, 为排行榜里的每个模型计算归一化的 Elo 分数。
于xAI, 其运行测试借助官方基准仓库来开展, 之后会报告评分细则(rubric score)以及归一化Elo分数 该所有的分数都是在遵循基准要求的状况下进行计算 此计算运用默认采样参数 还有指定的评判模型(Claude Sonnet 3.7) 并且不添加system prompt。
结果呈现出这样的情况, Grok 4.1 当中, 其具有的推理模式, 以及非推理模式, 在榜单之上处在了前两名的位置。

以下示例展示了 Grok 4.1 对情绪类提示的回应方式:

创意写作
4.1系列模型的表现, 被xAI, 在Creative Writing v3基准测试上, 进行了评估。
身处该基准范围里, 模型得针对 32 个各异的写作提示以产出回答, 并且要历经 3 轮的迭代过程。如同 EQ - Bench的状况那样, 评分是同时依据评分细则以及模型对战所产生的归一化 Elo 分数来予以计算的。
其结果给人以这样的呈现, Grok 4.1 的那种推理模式, 以及并非推理的模式, 在基准测试里所处位次为第二和第三这两个名次, 仅仅排在早期的 GPT 5.1 的之后。

以如下示例呈现了, Grok 4.1 于创意写作提示状况下的回答途径。

减少幻觉
存在配备搜索工具的Fast(非推理)模型, 该模型能够提供即时答案, 然而, 因为推理深度受到限制, 并且工具调用次数也呈现出有限的状况, 所以它们会更加容易出现事实性差错。
在 Grok 4.1 的后训练进程当中, xAI 着重使信息查询类提示的事实幻觉得以降低。随后, xAI 在抽样的生产环境信息查询提示里面观察到了幻觉率的显著下降了。
xAI运用源自生产流量的真实信息查询请求, 依照类别进行分层抽样, 以此来评估模型幻觉率。与此同时, 还对FActScore进行了评测, 它是一个涵盖500个关于不同人物的传记类问题的公共基准测试。

更多 Grok 4.1 的技术细节请参阅模型卡:

标签: 人工智能 机器学习 自然语言处理 模型评估 技术发布
还木有评论哦,快来抢沙发吧~