基准测试上个月·MSN
Relay-Bench 新基准:GPT-5.5 跨域推理仅获 43% 正确率arXiv 上发布的新基准 Relay-Bench 将七个推理领域的问题串联在单个提示中,测试模型的跨域推理能力。结果显示当前前沿模型 GPT-5.5 仅获得 43% 的正确率,表明 AI 在多领域连续推理方面仍有巨大提升空间。(据 MSN/arXiv 于 2026 年 7 月 22 日报道)
每日精选 AI 行业动态,点开标题可直达原文出处。
arXiv 上发布的新基准 Relay-Bench 将七个推理领域的问题串联在单个提示中,测试模型的跨域推理能力。结果显示当前前沿模型 GPT-5.5 仅获得 43% 的正确率,表明 AI 在多领域连续推理方面仍有巨大提升空间。(据 MSN/arXiv 于 2026 年 7 月 22 日报道)