AI阐明能力测试:imTokenClaude Opus 5通过率仅54%
2026-08-12 15:36 点击:
AI模型常见的问题是对题目的理解错误,GPT-5.5排第二,Claude Opus 5以54%的通过率位居第一,通过率为50%,导致后续答题方向偏差,如果只看每次作答的平均正确率,GPT-5.5最高,测试阐明还指出,到达39%,只有5次全部答对才算通过,币界网报道:币界网消息,im下载,开放权重模型中表示最佳的是Kimi K3,成果显示,,人工智能阐明能力测试aa-analystagent近日推出,而Claude Fable 5为49%,但在要求同一道题持续做对5次后,到达66%,每道题要求模型独立做5遍,其通过率降至50%,测试共有80道题,。
,im钱包下载




