AIが一筆ずつペイントアプリを操作
4モデルは、モナ・リザ、星月夜の参照画像2点と、漁師、夕日、赤いバラ、猫、暖炉のある室内という5つの文章指示を描きました。各モデル7枚、合計28枚です。
画像生成モデルの性能比較ではありません。汎用AIが同じペイントアプリで色、太さ、筆圧、線、ぼかし、消しゴムを操作した実験です。TryAI自身も、曖昧で正解のない課題であり、客観的な総合ランキングではないと説明しています。
TryAIはGPT-5.6 Solを品質首位と評価
GPT-5.6 Solは平均29ステップ、6.2分、推定7.74ドルで7枚を完成。TryAIは特に「星月夜」と赤いバラを高く評価し、老漁師を除く多くの作品で他モデルより細部が優れていたとしています。
4モデルの実行量と費用
| モデル | 平均ステップ | 平均時間 | 合計トークン | 推定コスト | 自己評価 | 描画呼び出し |
|---|---|---|---|---|---|---|
| GPT-5.6 Sol | 29 | 6.2分 | 340万 | 7.74ドル | 6.0 | 116 |
| Claude Fable 5 | 54 | 12.5分 | 1460万 | 160.58ドル | 15.6 | 207 |
| Grok 4.5 | 99 | 4.8分 | 3400万 | 9.21ドル | 4.3 | 354 |
| Gemini 3.6 Flash | 73 | 6.9分 | 2770万 | 12.87ドル | 22.6 | 190 |
少ない試行で描画方針を保てた
29ステップ4モデルで最少。長い試行錯誤を避けました。
116ドロー線の総呼び出しも最少でした。
340万トークンGrokやGeminiより大幅に少ない実行量です。
この結果は、描画技術そのものだけでなく、視覚状態を読み、次の操作を計画し、不要な反復を止めるツール利用能力を含みます。
CodexやComputer Useで見るべき指標
- 完成品質だけでなく、ステップ数とツール呼び出し数を記録する。
- 途中の自己評価が修正に役立ったか、単なる反復だったかを見る。
- キャッシュを含む実請求額と所要時間を同時に測る。
- 同じハーネス、同じ上限、同じ停止条件で比較する。


