これは日本語版です。韓国語版と 英語版もご覧いただけます。

Claudeが30超の生命科学AIを最適化、平均4倍高速化をどう読むか

2026-09-26 · AI · 日本 · Zoogom編集部

#Anthropic#Claude#生命科学AI#タンパク質設計#GPU最適化#FlashPairformer

複数の生体分子予測モデルを一つのAI支援型最適化システムで高速化するイメージ

Anthropicは、Claudeを使って30を超えるオープンソースの生命科学モデルを4週間未満で最適化したと発表した。同社の評価では、わずかな数値精度の変化を許容する高速設定により、対象処理が平均で約4倍速くなったという。計算結果を同一に保つ条件でも高速化は確認されたが、改善幅は小さくなる。

注目すべきなのは、Claudeが一つのタンパク質構造を予測したことではない。構成の異なる多数の科学ソフトウェアを調べ、処理のボトルネックを特定し、GPU向けの低レベル処理やメモリ使用を改善したとされる点だ。つまり今回の発表は、AIが研究開発向けコードの性能改善をどこまで支援できるかを示す事例として位置づけられる。

ただし、約4倍という数字を生命科学AI全般の確定した性能と受け取ることはできない。これはAnthropic社内の研究モデルと評価環境による測定結果であり、独立した第三者による再現結果ではない。また、最大規模の実験では計算自体は完了しても、科学的に正しい構造を予測できなかった。

要点

公表された数字と読み方

主要な測定項目、Anthropicの報告値、解釈する際の注意点

今回の対象は単一のモデル群ではない。Anthropicの公式研究発表によると、生体分子構造の予測、タンパク質設計、タンパク質言語モデル、ゲノミクスなど、設計思想の異なるソフトウェアが含まれていた。

そのため、共通の設定を一つ変えるだけで、すべてが速くなったわけではない。Claudeは、繰り返し発生する計算のキャッシュ、実際には一定値しか返さない不要な分岐の置き換え、モデルごとの処理経路の見直しなどを行ったとされる。さらに、GPU上で特定の演算を効率よく実行するカスタムカーネルの開発にも関わった。

作業は完全な無人運用ではなかった。Anthropicの技術スタッフ2人が監督し、目標の設定、速度と精度の確認、変更を採用するかどうかの判断を担当した。同社によれば、この2人は生体分子モデリングの経験を持っていたが、推論処理の最適化やGPUカーネル開発の経験はなかったという。

したがって、今回の事例は「Claudeだけで研究用ソフトウェアを自動的に完成させた」という話ではない。人間が検証と意思決定を担うなかで、AIが多数のコードベースの調査と実装を支援した成果として見るのが適切だ。

FlashPairformerは何を高速化したのか

生体分子の構造予測では、分子を構成する要素どうしの関係を扱う計算に多くの時間とメモリが必要になる。とりわけ、三つの要素の幾何学的な関係を捉えるための「triangle attention」と「triangle multiplication」は、対象が大きくなるほど負荷が急増する処理だ。

Anthropicは、Claudeの支援によって、これらの演算を高速化するGPUカーネル群「FlashPairformer」を開発したと説明している。同社が示した比較では、triangle attentionは平均2.7〜2.9倍、triangle multiplicationは構成に応じて1.7〜3.2倍高速になった。

ただし、特定の演算が速くなることと、モデル全体が同じ倍率で速くなることは別である。実際の推論には、入力データの準備、ほかのニューラルネットワーク層、結果の後処理なども含まれる。Anthropicは、共通カーネルとモデル固有の修正を組み合わせた結果、構造予測モデルで平均約4倍の高速化を得たとしている。

「平均4倍」と「同一出力」は分けて考える

最も大きな改善値は、科学的な評価をおおむね維持しながら、限定的な数値精度の変化を認める高速モードで測定された。変更前と完全に同一の出力を要求すると、利用できる最適化手法が減るため、速度向上も小さくなる。

Anthropicの全体要約では、同一出力を維持した場合でも約2倍に近い高速化が得られたとされる。一方、構造予測モデルに絞った説明では、同条件の改善は約1.6倍とされている。対象範囲が異なる数字であり、どのモデル、入力サイズ、GPUでも一律に同じ倍率になるという意味ではない。

この違いは、実際の研究工程でも重要になる。多数の候補をふるいにかける初期探索では、評価順位や科学的指標が保たれるなら、わずかな数値差を許容して処理件数を増やす選択肢があり得る。一方、最終結果の再現、論文での報告、厳格な検証が必要な用途では、処理速度より決定性や数値の安定性を優先すべき場合がある。

多数のGPUノードを使う従来型ワークフローと、単一ノードへの集約および人間による検証工程の比較

低メモリのBigモードと単一ノードの限界

対象となる分子系が大きくなると、Pairformer系の処理に必要な計算量とメモリも急増する。Anthropicは、Claudeが作成した低メモリの「Big」モードにより、1万トークンを超える一部の生体分子系を単一のNVIDIA GPUノードで正確に予測できたと報告している。

ここでいうトークンは、一般的な生成AIの文章用トークンではない。アミノ酸、核酸、低分子やイオンを構成する原子など、生体分子系を計算上で表す単位を指す。

同社は、人のミトコンドリア複合体I、TRiCシャペロン、プロテアソーム、細菌リボソームなどについて、実験で得られた構造に近い予測結果が得られたとしている。従来は複数のGPUノードを必要とした規模の処理を単一ノードへ収められるなら、大規模な計算設備を持たない大学研究室や小規模なバイオ企業にも恩恵が及ぶ可能性がある。

一方、さらに大きな対象では明確な限界も確認された。8基のB300 GPUで構成された単一ノードを使い、3万1000超から7万超のトークンを持つウイルスカプシドやタンパク質区画などを動かす実験は完了したものの、予測された構造は崩壊し、正確ではなかった。

これは重要な区別である。データがGPUメモリに収まり、プログラムが最後まで動いたとしても、そのモデルが未知の大規模構造を科学的に正しく扱えるとは限らない。7万トークン超について確認されたのは実行可能性であり、正確な構造予測ではない。

タンパク質設計のコスト削減が示す範囲

Anthropicの以前のタンパク質設計実験では、標的一つにつき最大1万ドル、約2500時間分のNVIDIA H100 GPUを使える条件が設定されていた。今回の簡略化されたワークフローでは、Claudeモデル一つ、H200 GPU一基、24時間という構成が採用された。

Anthropicによれば、16の標的に対するインシリコの結合評価では、中央値と最良値が以前のキャンペーンと同程度だった。GPUとAI利用に伴うトークンの推定費用は合計約150ドルで、GPU時間は約100分の1になったという。

しかし、この数字はタンパク質や医薬品候補を150ドルで完成させられることを意味しない。インシリコ評価はコンピューター上の予測であり、実験室での検証とは異なる。候補タンパク質が実際に合成・発現できるか、標的に結合するか、十分に安定しているか、安全性に問題がないかは別途確かめる必要がある。

Anthropicは、別のタンパク質設計コンテストに共同で関わり、5000を超える設計を実験的に検証する計画も示している。ただし、これは今後の取り組みであり、その結果を今回の計算上の成果に含めることはできない。

公開コードで何を検証すべきか

Anthropicは、最適化済みコードと技術報告を公開したとしている。これにより、外部の研究者が別のGPU、データセット、ソフトウェア環境で速度、メモリ使用量、精度の関係を調べられる。

公平に比較するには、使用するハードウェア、入力サイズ、コンパイラー設定、事前のウォームアップ回数、計測範囲、精度の合格基準をそろえる必要がある。コンパイル時間を測定に含めたか、成功した事例だけが選ばれていないか、採用されなかった最適化がどの程度あったかも確認すべきだろう。

また、低レベルのGPUコードは高速でも、まれな数値誤差、並列処理上の競合、特定デバイスだけで発生する不具合を含む可能性がある。科学計算では小さな差が研究上の結論に影響することもあるため、回帰テスト、専門家によるコードレビュー、対象分野の指標を使った検証は省略できない。

日本の研究機関やバイオ企業が取るべき対応

実務上の示唆は、GPUを追加購入することだけが計算能力を高める方法ではないという点にある。既存の処理をプロファイリングし、メモリ消費や繰り返し実行される演算を特定すれば、同じ設備でより多くの候補を試せる可能性がある。

導入時には、まず公開コードのライセンスと依存関係を確認し、組織内の基準データで元のモデルと最適化版を比較する必要がある。処理時間だけでなく、最大メモリ使用量、数値差、失敗率、再現性、研究上の評価指標を記録し、信頼性が確認できるまでは探索用途に限定するのが現実的だ。

患者に関連する情報、未公開の標的、独自の化合物データを扱う場合は、コードがオープンソースであることと、外部AIサービスへ機密データを送ってよいかどうかを分けて考えなければならない。

費用についても、約150ドルという実験値だけで判断すべきではない。実際の研究コストには、エンジニアによる確認、再実行、データ保管、候補の合成、実験、失敗した試料、カーネルの保守などが含まれる。比較すべきなのは計算一回の価格ではなく、検証を通過した成果一件あたりの総費用である。

実用的な結論

今回の発表で重要なのは、Claudeが生命科学について説明できることではなく、構成の異なる多数の研究用コードを調べ、性能上の問題を修正したと報告された点だ。第三者が成果を再現できれば、研究者は同じGPU環境でより多くの候補を評価し、これまで複数ノードを必要とした一部の処理を小さな構成で実行できる可能性がある。

ただし、現時点で確認されているのはAnthropicによる公式発表であり、独立検証済みの一般的な性能保証ではない。約4倍は条件付きの平均値で、同一出力を求めれば改善幅は小さくなる。7万トークン超の計算は完走しても構造予測に失敗しており、インシリコのスコアもウェットラボでの成果を保証しない。

実際に採用する組織は、公開された実装を自らのデータと設備で再評価し、速度と科学的妥当性を同時に確認する必要がある。AIによる最適化は研究の処理能力を広げる手段になり得るが、人間による検証を置き換えるものではない。

出典と利用について

Anthropic、Claude、NVIDIAおよび関連する名称・商標は、それぞれの権利者に帰属する。本記事はAnthropicの提供、後援、承認を受けた公式コンテンツではない。公式研究発表に記載された事実、数値、留保を独自の構成と表現で整理し、企業による測定結果と第三者による独立検証済みの結果を区別している。掲載画像は編集用に制作されたイメージであり、実在する研究室の写真、製品画面、報告されたタンパク質構造を複製したものではない。

出典: Anthropic · 独自の画像・図版を含みます