arXiv 上发布的新基准 Relay-Bench 将七个推理领域的问题串联在单个提示中,测试模型的跨域推理能力。结果显示当前前沿模型 GPT-5.5 仅获得 43% 的正确率,表明 AI 在多领域连续推理方面仍有巨大提升空间。(据 MSN/arXiv 于 2026 年 7 月 22 日报道)
来源:MSN
arXiv 上发布的新基准 Relay-Bench 将七个推理领域的问题串联在单个提示中,测试模型的跨域推理能力。结果显示当前前沿模型 GPT-5.5 仅获得 43% 的正确率,表明 AI 在多领域连续推理方面仍有巨大提升空间。(据 MSN/arXiv 于 2026 年 7 月 22 日报道)
https://www.msn.com/en-us/news/technology/new-ai-benchmark-holds-gpt-5-5-at-43-on-cross-domain-reasoning-chains/ar-AA28ttfK
评论
0