摘要
Endor Labs 测试发现,同一模型在不同框架(Harness)上性能差异巨大:OpenAI 的 GPT-5.5 在原生 Codex 框架上功能正确率为 61.5%,在 Cursor 上达 87.2%;Anthropic 的 Opus 4.7 在 Claude Code 上为 87.2%,在 Cursor 上为 91.1%。
Endor Labs 测试发现,同一模型在不同框架(Harness)上性能差异巨大:OpenAI 的 GPT-5.5 在原生 Codex 框架上功能正确率为 61.5%,在 Cursor 上达 87.2%;Anthropic 的 Opus 4.7 在 Claude Code 上为 87.2%,在 Cursor 上为 91.1%。