Rails Foundationは2026年8月13日、Ruby on Railsタスクに対するコーディングエージェント比較プロジェクト
Agents on Rails: We ran 8 models against 21 atomic tasks to see which were best at writing Rails code. 3 runs each: a bug report, a security finding, a feature request.
— Ruby on Rails (@rails) August 13, 2026
The first benchmark report with findings is now live. So: what did we discover?
As of August 2026:
- Most… pic.twitter. com/ xs8zItKWca
使用したモデルは以下の8種。
- Anthropic Claude Opus 5
- Anthropic Claude Fable 5
- MoonshotAI Kimi-K3
- OpenAI GPT-5.
6 Sol - OpenAI GPT-5.
6 Luna - Meta Muse Spark 1.
2 - Z.
ai GLM-5. 2 - DeepSeek V4 Flash
またこれに加えて、SpaceXAI Grok 4.
今回行ったベンチマークでは、おもに以下のような結果となった。
- 正確性:有効なタスク実行ではClaude Opus 5が最も高く、92%の問題を解決
- コスト:GPT-5.
6 Lunaがデフォルトの中程度の推論レベルで73%の精度を保ちつつ、63回の実行で合計91セントとなった。 - 速度:GPT-5.
6 Lunaが最も速く、1タスクあたりの平均実行時間は3. 3分
また精度とコスト、実行速度のバランスが最もとれたモデルはGPT-5.
なお、単純な実行精度においてClaude Fable 5は95%とトップの成績をマークしたが、Anthropicの制限により、セキュリティレポートのようなタスクを解決することを拒否したため、利用には注意が必要とされた。
詳しいベンチマーク結果はAgents on Railsのページを参照。