Artificial Analysisの更新済みAA-Briefcaseベンチマークによると、Kimi K3は1543 Eloポイントを達成し、Claude Fable 5の1574に次ぐ結果となりました。GPT-5.6 Solはこれを上回りました。
このベンチマークでは、91件の機密タスクにわたって、モデルを情報抽出、ドキュメント分析、成果物生成の各観点で評価します。
しかし、K3のパフォーマンス向上には大幅に高いコストがかかりました。1タスクあたり$10.57で、これはKimi K2.6の約10倍です。モデルの平均は83回の反復で、1タスクあたり120,000トークンを生成し、完了までに56.4分を要しました。これはFable 5の約2.5倍の長さです。