少し前まで、モデル選びは「いちばん賢いのを選ぶ」で終わる話でした。今はそうもいきません。エージェントとして動かすとトークンの減り方が読めなくなって、上位モデルだけで組むと月の途中で止まります。

実際に止めました。ある量産案件で上位モデルだけを並列で走らせていたら、月次の使用上限に当たって処理が停止し、未完成の成果物が4本残りました。作りかけが残るのがいちばん高くつく、というのはこのとき体で覚えたことです。

そこから構成を組み替えて、今は上位モデルを司令塔に置き、実作業をミドルクラスのサブエージェントに配る形で回しています。この記事では、2026年8月時点の中位帯モデルの並びを押さえたうえで、その運用で何が起きたかを書きます。価格やベンチマークは公表値、運用の話はうちで測った範囲の実測です。

まず、2026年8月のミドルクラスはこう並んでいる

値段から見ていきます。以下はいずれも100万トークンあたりの入力/出力です。

Anthropicは現在4段構成で、最上位のFable 5が10ドル/50ドル、Opus 5が5ドル/25ドル、Sonnet 5が2ドル/10ドル、Haiku 4.5が1ドル/5ドル。Opus 5は7月24日に出たモデルで、前世代のOpus 4.8と同じ価格のまま中身を入れ替えてきた形です。effortをlowからmaxまで切り替えられるので、上位モデルであっても消費を落とす余地が残っています。

OpenAIはGPT-5.6世代がSol、Terra、Lunaの3層。Solが5ドル/30ドル、Terraが2ドル/12ドル、Lunaが0.2ドル/1.2ドル。Terraは7月30日に2.5ドル/15ドルから値下げされました。世代番号とは別に、この3つは継続する階層名として扱われています。

GoogleはGemini 3.7 Flashが8月13日にGA。0.75ドル/3.75ドルで、この帯では頭ひとつ安いです。ただしこれは2026年12月31日までの価格で、2027年1月1日から1.5ドル/7.5ドルになることが公表されています。倍です。今この安さを前提に構成を固めると、年明けに計算をやり直すことになります。

こうして並べると、中位帯はおおむね上位の半額前後に収まっていて、公表ベンチマークの数字も上位に近い。ならミドルクラスだけで組めばいいのでは、という話になりそうなのですが、うちで比べたときに分かれ目が出たのはそこではありませんでした。

点数が近くても、崩れる場所が違った

7月の頭に、統制を効かせた比較をやっています。連作の長文コンテンツを作る案件で、同じ設定資料と同じ構成メモを入力に渡し、上位モデルが先に書いた版を見せない状態で、Sonnet 5に同じ章を書き直させました。

結果は章によってはっきり割れました。

先行する10章分の実文がすでに手元にある状態で書く継続章は、上位モデルとほぼ互角でした。体感で95%から100%、しかも上位モデルが出さなかった良い一手が混ざる場面もありました。ここは正直、想像より強かったです。

一方、先行が2章しかない段階の、いわば型を決める章は違いました。文章そのものは悪くない。ただ、あとから効いてくる制約を先食いしていたり、まだ出してはいけない情報を早めに出していたりして、修正必須の設計違反が複数出ました。文だけ読むと分からないのがやっかいなところです。

ここから読み取ったのは、ミドルクラスの弱点は文章力ではなく、「この判断が後続にどう効くか」の見通しの距離だということでした。確立したパターンの中を走らせると上位モデル並に走る。パターンそのものを決めさせると、目の前は最適でも先で破綻する選択をする。

そして、この差はベンチマークの点数からは読めません。SWE-bench Proが63.2%とか、Coding Agent Indexが77.4といった数字は候補を絞るのには使えますが、「どこで崩れるか」は自分の作業で測るしかないと思っています。

型は上位モデルが直筆し、量はミドルクラスに配る

比較の結果を運用に落とすと、分担は素直に決まりました。

型にあたる正本、つまり全体の設定資料と文体の基準は、オーケストレーターである上位モデルが自分で書きます。ここはサブエージェントに委任しません。そこから先の実作業は、1単位につき1つのサブエージェントを立てて配ります。使うのはSonnet 5です。

もうひとつ効いたのが、サブエージェントを毎回まっさらなコンテキストで起動することでした。1つの長い会話の中で作業を積み上げていくと、前の判断の残りかすが後ろに効いてきて、途中から品質が読めなくなります。単位ごとに切ってしまえばそれが起きません。かわりに、前の単位で決まったことは申し送りとして明示的に渡します。暗黙で共有させない、というのがポイントでした。

この形にしてから、直近では10本の並列案件を全数、上位モデルへの昇格なしで完走できています。1本あたりの消費は28万から51万トークン、時間にして25分から45分といったところです。途中で4件の差し戻しが出ましたが、それもサブエージェント側で直しきっていて、司令塔が自分で本文を編集した場面はありませんでした。

ただ、ここは正直に書いておくと、品質判定には自己申告に依存している部分がまだ残っています。市場での検証まで終わった話ではありません。

任せると必ず出てくる癖が3つある

運用していて再現性があった失敗を挙げます。ミドルクラスに実作業を任せるなら、たぶんどれも先回りしておいた方がいい類のものです。

1つ目は、委任の逸脱です。起動直後のサブエージェントが、自分で本文を書かずに別のエージェントへさらに投げて、そのうえで完了報告を返してきたことがありました。報告だけ見ると終わっているように読めます。指示書の冒頭に「さらなる委任は禁止、全工程を自分で走る」と明記して止めました。

2つ目は、同じ言い回しの反復です。文と文をつなぐための緩衝句が、1単位のなかで10回から15回くらい出てきます。禁止語のブラックリストには引っかからないので、機械チェックをすり抜けます。うちでは「同系統の表現は8回以下」と数値で切って、指示書側でゲートにしました。

3つ目がいちばん厄介で、世界観の外にある語彙の混入です。西洋を舞台にした作品の照明として、和風の器具名が22箇所入っていたことがありました。日本語として正しく、禁止語でもないので、lintでは絶対に拾えません。舞台に合う小物や照明の語を指示書で名指しするようにして、以後は検収時にgrepで裏を取っています。

3つに共通しているのは、指示に書かれていない部分を埋める強度が弱いことだと思っています。上位モデルは書いていないことを勝手に補完してくれるぶん、雑な指示でもそれなりに成立します。ミドルクラスは書いてある範囲を丁寧に最適化してくるので、指示の穴がそのまま成果物の穴になる。だから指示書を書く時間は減らず、むしろ増えます。ここを見落とすと、モデル代は下がったのに全体の工数が下がらない、という結果になります。

検収の姿勢も変わりました。サブエージェントの自己報告は信用せず、毎回オーケストレーター側でチェックを再実行し、grepで実物を確認しています。手間に見えますが、差し戻しが1件見つかるだけで元が取れます。

他社のミドルクラスを同じ枠に入れてみると

同じ比較をGPT-5.5 highでも一度やりました。Codex経由です。

型を決める章の設計遵守は、Sonnet 5より明確に良かったです。先食いはゼロで、構造上のミスも局所的に直せる範囲のものが1件だけでした。継続章も上位モデルの90%から95%くらいには来ていて、良い一手も出ます。

ただ、文体の「声」が系統的にずれました。指定した記号を使わないなど、スタイル指定を明示しても直りきらない部分が残り、採用するなら声を整える後編集の工程が必ず要る。その工数を足すと、コスト面の利点は相殺されます。うちの結論としては、GPT-5.6系は制作の本体より、第三者としての整合チェックやレビューに置いた方が効きます。実際、コードレビューは今もCodex側に投げています。

Gemini 3.7 Flashは、この帯では価格が抜けています。前世代からの伸びも大きくて、公表値ではDeepSWE v1.1が49.0%から65.3%、Terminal-bench 2.1が78.0%から85.8%まで上がりました。ただ2027年の改定でSonnet 5との差はかなり詰まるので、価格だけを理由に寄せるなら、そのときに戻れる設計にしておく必要があります。

さらに下のLunaやHaiku 4.5も候補にはなりますが、下げすぎると検収での手戻りが増えて、結局トータルで高くつく場面がありました。どこまで下げられるかは作業の性質次第で、一律には決められないと感じています。

コストは「安いモデル」ではなく「止まらない構成」で見る

最初に書いた、上限に当たって止まった話に戻ります。

あのとき効いたのは単価ではなく、全部を同じモデルに寄せていたことでした。1か所で詰まると全部が同時に止まる。今は作業の性質でモデルを振り分けたうえで、並列も分けて走らせています。単価が下がったのは結果で、狙っていたのは一斉停止を避けることの方でした。

Opus 5のeffort切替も同じ発想で使えます。上位モデルを使うかどうかの二択にせず、上位モデルの強度を落として使う選択肢が増えた、と考えると構成の自由度が上がります。

決める順番

モデル比較の記事なのに変な結びになりますが、うちではモデルを最初に決めていません。順番としては、まず型を誰が作るかを決めて、次に検収をどう機械的に回すかを決めて、最後にどの作業にどのモデルを当てるかを決めています。この順番が逆になると、安いモデルに寄せたのに手戻りで沈む、という形になりやすいです。

そのうえで価格の話をすると、この3か月だけでもTerraが値下げされ、Geminiが期限つきの安値を出し、Opus 5が据え置きで中身を入れ替えました。年明けにはGeminiの改定も控えています。一度決めて終わりにできる状況ではないので、月単位で見直す前提で組んでおくのが現実的だと思います。