ニュース

Anthropic、「Claude Sonnet 5.5」を発表 ~30%以上高速に、コストは最大30%減

「Claude 5.5」ファミリーの第2弾。ベンチマークによっては「Opus 5.5」に迫る

Anthropic、「Claude Sonnet 5.5」を発表

 米Anthropicは9月28日(現地時間、以下同)、「Claude Sonnet 5.5」を発表した。「Opus 5.5」に続く「Claude 5.5」ファミリーの第2弾で、先代の「Sonnet 5」からは30%以上も高速化。多くの作業でコストは最大30%安くなるという。高頻度・コスト重視の用途に向けた「Claude Haiku 5.5」も、数週間のうちにファミリーへ加わる予定だ。

 「Sonnet 5.5」は「Opus 5.5」を補完する、より高速で低コストなモデル。範囲のはっきりした日常的なタスクやバグ修正などに向いている。デザインも巧みで、体裁の整った文書・スライド・スプレッドシートの作成といったタスクも得意だ。

  • Fable 5.1:高難度の推論や長時間のエージェント作業向けだが、コストも高い
  • Opus 5.5:慎重な判断を要する複雑な作業向け
  • Sonnet 5.5:範囲のはっきりした日常的なタスク向け(今回リリース)
  • Haiku 4.5:高頻度・コスト重視の用途に

 ベンチマークでは、先代「Sonnet 5」からの飛躍がみてとれる。「Opus 5.5」には及ばないものの、なかには肉薄、もしくは凌駕するテストさえある。スクリーンショットだけを頼りに『ポケットモンスター 赤』をクリアした初の「Sonnet」でもあるとのこと。判断力を長く保ち続ける必要がある複雑で自由度の高い作業では「Opus 5.5」が明確に強いままだが、日常的な業務であれば「Sonnet 5.5」でも十分と言えるだろう。

各種ベンチマーク比較

 また、コスト効率にも優れる。100万トークンあたりの価格は入力2米ドル、出力10米ドル、キャッシュ読み取り0.20米ドルで「Sonnet 5」と同額だが、同じ作業に必要なトークン数が大きく減ったため、同社のテストではタスクあたりのコストが最大30%下がったという。いくつかのベンチマークでは、「Sonnet 5.5」の「Low」または「Medium」設定で「Sonnet 5」の最高スコアを上回ったが、コストは1/10程度に過ぎなかった。

努力(effort)レベルごとのスコアとタスクあたりコスト。左上に近いほどコストパフォーマンスが高い

 そのほかにも、安全性を強化。約1,850のシナリオを用いる自動行動監査で、アライメントや誤用への耐性、正直さのほとんどの指標において「Sonnet 5」と同等以上であるとのこと。サンドボックスから抜け出そうとする頻度の低さでは「Opus 5.5」に迫り、コンテナーの限界を探ろうとする傾向は同社のモデルでもっとも低かったという。

 一方で、サイバーセキュリティ能力が「Opus 5」並みに向上したことから、「Sonnet」としては初めてセーフガードとフォールバックが追加された。通常のソフトウェア開発におけるバグの発見・修正は従来通り行えるが、「Opus 5.5」と同様、リスクの高いサイバーセキュリティ関連のタスクは「Sonnet 5」へ明示的にフォールバック(切り替え)される(生物学分野のセーフガードは「Sonnet 5」と同等)。また、大量の偽アカウントでモデルの能力を抜き取る“蒸留攻撃”への対策として、推論の抽出を防ぐ安全性分類器が「Sonnet」で初めて搭載された。

 「Sonnet 5.5」は「Amazon Web Services」(AWS)、「Google Cloud」、「Microsoft Azure」を含む、すべてのプラットフォームで提供中。APIで指定するモデル名は「claude-sonnet-5-5」で、ゼロデータ保持にも対応する。なお、「thinking」をオフにして「Sonnet」を使っている場合は、移行前に新しい「between_tools」設定へ切り替える必要があるとのこと。