基准测试上个月·MSN
Relay-Bench 新基准:GPT-5.5 跨域推理仅获 43% 正确率arXiv 上发布的新基准 Relay-Bench 将七个推理领域的问题串联在单个提示中,测试模型的跨域推理能力。结果显示当前前沿模型 GPT-5.5 仅获得 43% 的正确率,表明 AI 在多领域连续推理方面仍有巨大提升空间。(据 MSN/arXiv 于 2026 年 7 月 22 日报道)
每日精选 AI 行业动态,点开标题可直达原文出处。
arXiv 上发布的新基准 Relay-Bench 将七个推理领域的问题串联在单个提示中,测试模型的跨域推理能力。结果显示当前前沿模型 GPT-5.5 仅获得 43% 的正确率,表明 AI 在多领域连续推理方面仍有巨大提升空间。(据 MSN/arXiv 于 2026 年 7 月 22 日报道)
据 Geeky Gadgets 于2026年6月1日报道(引用 Universe of AI 的分析),OpenAI 的 GPT-5.6 模型预计将在2026年6月发布,在高级推理能力和智能体工作流方面带来显著提升。该版本着重增强了多步骤任务规划、工具调用和长期记忆能力,标志着 OpenAI 从"对话式 AI"向"自主执行式 AI"的战略转型。GPT-5.6 将与 Anthropic 的 Claude Opus 4.8 和 Google 的 Gemini 3.5 展开正面竞争。