Arena 平台上线了 OpenAI 的 GPT-6 Sol 与 GPT-6 Luna 两个版本,官方表示评分即将公布。用户现在就可以前往 Arena 实测这两款模型,投票结果将直接决定排行榜的座次。 值得注意的是,这次评测的落点不在传统问答,而在真实世界的智能体任务上。Arena 官方强调,用户在这些任务上的投票,才是驱动排行榜的核心数据来源。 一场同条件对决已经跑完 在评分正式公布之前,@petergostev 已经把 GPT-6 Sol 和 GPT-5.6 Sol 放在同一条件下做了一次正面对比。所谓同条件,指的是相同的提示词,并且两个模型都开启了最大推理强度。 这场对比考察的不只是两代模型之间的差异,还包括总 token 消耗和实际运行时间。换句话说,输出质量、token 用量、延迟表现,三个维度都被摆上了台面。 对比结果和 Peter 使用的提示词,已经发布在 YouTube 上,视频链接为 youtu.be/jVFz7cTeQxk。 为什么这次评测值得盯 从 Arena 的表述看,GPT-6 这一代的评测重心明显偏向智能体任务。这类任务和单轮问答不同,模型需要连续决策、调用工具、在多步操作中保持目标一致,对 token 效率和响应速度的要求也更苛刻。 把 token 用量和 wall-clock time 纳入对比,意味着评测不再只看“答得对不对”,还要看“花多少代价答对”。对开发者来说,这直接关系到实际部署时的成本和体验。 目前 GPT-6 Sol 与 GPT-6 Luna 的正式评分尚未公布,Arena 只给出了“即将到来”的说法。两个版本之间的定位差异、各自擅长的任务类型,都还没有官方数据支撑。 能确定的是,用户投票通道已经打开。在真实智能体任务上的每一次投票,都会进入排行榜的计算。至于 Sol 和 Luna 谁更胜一筹,要等评分揭晓才能见分晓。 特别
勇士主教练:库里将天赋、谦逊和品格集结在一起,我不想离开这里
这里的足球课程注重团队合作和个人技术,让每位学员都能在训练中得到成长!...
库里谈未来:我哪儿也不会去 我要为自己和球队做出正确的决定
这里的足球课程注重团队合作和个人技术,让每位学员都能在训练中得到成长!...