AI・生成AISakana AIの新モデル「Fugu」、GPT-6 AstraもClaudeも使わずに上回れるのか。Max/Ultra v2の中身を確かめる
Sakana AIが2026年9月11日、AIを指揮する「オーケストレーター」型モデルの新版Fugu MaxとFugu Ultra v2を発表。トークン単価を最大6割減らしつつ視覚推論48.3点で上位モデルを上回ったという主張の中身を確かめた
まず初めに
*「うちの最強モデルは使ってません」と言いながら最強モデルに勝ったと主張する会社、初めて見た。*Sakana AIは自前の巨大モデルを1つも持たず、他社が育てた既製のAIモデルをかき集めて指揮するだけの立場でありながら、その指揮ぶりだけでOpenAIの新型「GPT-6 Astra」やAnthropicの「Claude Fable 5・5.1」を、しれっと蹴落としたと言っている。楽団を持たない指揮者が、他の楽団を借りてきて名門オーケストラより上手いコンサートを開いたようなものだ。腕前は認めるとしても、借り物の楽団が急に演奏をやめたらどうするのか、という不安は正直ついて回る。※個人の感想です
何が起きているのか
Sakana AI(サカナAI)は、東京に本拠を置くAI企業です。2026年9月11日、AIを組み合わせて動かす「オーケストレーター」型モデル「Fugu(フグ)」シリーズの新版として、「Fugu Max」と「Fugu Ultra v2」を発表しました。
Fuguは、単体の大規模言語モデルではありません。利用者が1つのAPIに向けて1回の依頼を送ると、Fugu自身がその作業を、内部に抱える多数のオープンウェイト(重みデータが公開された)モデルや特化型モデルの中から最も適したものへ振り分け、出てきた結果をつなぎ合わせて1つの答えとして返す仕組みです。今回の新版では、NVIDIAが公開しているオープンウェイトモデル群「Nemotron」が新たに連携先に加わりました。
2つの新版は目的が異なります。Fugu Maxは「同じ予算でどこまで良い答えを出せるか」を追求したモデルで、価格は入力100万トークンあたり2ドル(キャッシュ利用時0.25ドル)、出力100万トークンあたり6ドルです。Sakana AIによれば、これは「Claude Sonnet 5」「GPT-5.6 Terra」「Kimi K3」といった競合モデルと比べて、出力コストを4〜6割抑えた水準だとしています。一方のFugu Ultra v2は「難しい複数手順の作業でどこまで良い答えを出せるか」を追求したモデルで、価格は入力100万トークンあたり5ドル(キャッシュ利用時0.5ドル)・出力100万トークンあたり30ドルで、文脈の長さが27万2000トークンを超えると入力10ドル・出力45ドルに上がります。
*値段だけ見ると「安いのか高いのかよく分からない」というのが正直な感想だ。*性能面では、Fugu Ultra v2は視覚的な情報の読み取りや推論(与えられた情報から答えを導き出す処理)を試す「Chartography」というベンチマークで48.3点を記録し、Anthropicの上位モデル「Opus 5」(27.3点)や「Fable 5」(29.5点)を上回ったといいます。プログラミング能力を試す「DeepSWE」でも74.3点を記録し、8つの難関ベンチマークのうち5つで最上位という結果だったとSakana AIは説明しています。
なぜ重要なのか
今回の発表が注目されるのは、Fugu Ultra v2がこうした結果を、GPT-6 Astra・Claude Fable 5・Fable 5.1という、いずれも今回の連携先モデルには含まれていない3モデルを一切使わずに達成したと説明している点です。つまりSakana AIは「最強とされる他社の最新モデルを借りなくても、複数の既存モデルの組み合わせ方を工夫するだけで、それらに匹敵する結果を出せる」と主張していることになります。
これまでのAI業界では、性能を上げるために各社がより大きな独自モデルを開発する競争が中心でした。Fuguのアプローチは、その競争に加わらず「他社が作ったモデルをどう組み合わせて使うか」という別の土俵で勝負している点が特徴です。既存のFuguを使っている開発者は、APIのパラメーターを1行変更するだけでFugu MaxまたはFugu Ultra v2に切り替えられ、APIの仕組み自体は変わらないため、移行の手間が小さいこともSakana AIは強調しています。
私たちへの影響
一般利用者がFugu Max・Fugu Ultra v2を直接使う場面は今のところ多くありません。主な利用者は、AIを使ったサービスやアプリを開発する企業・エンジニアです。ただし、こうした企業が開発コストを抑えられれば、AIを使った製品やサービスの利用料金が下がったり、これまでコストの都合で難しかった機能が実現しやすくなったりする可能性があります。
一方で、Fuguのようなオーケストレーター型モデルは、内部で使う個々のモデルの性能や提供状況に依存する仕組みでもあります。連携先のモデルが値上げされたり提供を停止したりした場合、Fugu側の性能や価格にも影響が及ぶ可能性があり、単体の自社モデルを使うサービスとは異なるリスクを抱えていると言えます。
初心者が知っておくべきこと
「オーケストレーター」という言葉は、オーケストラの指揮者のように、複数の要素をまとめて指示を出す役割を指す言葉としてIT業界で使われます。AIの文脈では、1つの巨大なAIモデルがすべての作業を1人でこなすのではなく、司令塔となるAIが「この部分は得意なAにやらせる」「ここは専門のBに任せる」と作業を振り分け、出てきた結果を取りまとめる仕組みを指します。料理でいえば、1人の万能シェフに全部作らせるのではなく、腕利きの担当者を集めた厨房を、司令塔となる1人がまとめて指示を出しながら1つの料理として完成させるイメージに近いといえます。
「ベンチマーク」は、AIモデルの性能を測るための共通のテスト問題集のことです。企業ごとに独自の基準で「高性能」と主張するだけでは比較が難しいため、業界で広く使われる共通のベンチマークで数値を出し合うことで、他社モデルとの比較がしやすくなります。ただし、ベンチマークの点数が高いことと、実際の業務で使いやすいことは必ずしも一致しない点には注意が必要です。
IT Postの見方――「借り物の楽団」で名門を出し抜く芸は、拍手に値するが長続きするかは別問題
IT Postでは、Sakana AIが自前の巨大モデルを持たずに、既存モデルの組み合わせ方の工夫だけで大手に伍する結果を出したという今回の発表を、素直に評価したいと考える。
*ただ、これは「他社の楽団を借りて名門オーケストラより上手いコンサートを開いた」という話であって、「自分の楽団を育てた」という話ではない。*借り物である以上、貸主(連携先モデルを提供する各社)の都合が変わればコンサートの中身も変わってしまう。今回GPT-6 AstraやClaude Fable 5・5.1を使わずに勝ったという主張は痛快だが、裏を返せば「その気になれば使わせてもらえない可能性もある」ということでもある。IT Postでは、指揮の腕そのものは買うとしても、楽団の入れ替わりに振り回されない体制をどこまで作れるかが、このアプローチの本当の実力を測る次の関門になると考える。※個人の感想です
生成AIによるイメージ。実物や実際の画面ではありません。
今後どうなりそうか
Sakana AIは、Fugu Max・Fugu Ultra v2ともに2026年9月11日から利用できるとしています。今回の発表では、既存のFuguユーザー向けの移行のしやすさが強調されており、今後も連携先モデルの追加や入れ替えが続くと見られます。IT Postでは、実際の開発現場でこの仕組みがどこまで安定して使われていくか、続報があればあらためて取り上げます。