TECHNOLOGY EXPLAINER
AI創薬とスクリーニング
― 1億個を計算で選べても、律速は「合成」と「測定」に残る
創薬の探索は、実験で数を当たるハイスループットスクリーニング(HTS)から、 計算で1億個単位の分子をふるいにかける段階へ広がりました。 ただし論文を読むと、計算で選んだ候補も溶けにくさ・代謝の速さで一度は引っかかり、 最後は合成して測るところで決まっています。
- AI創薬とスクリーニング(3行でつかむ)
- なぜ「探し方」の効率が問われるのか
- ハイスループットスクリーニング ― 実験で数を当たる
- 素材技術者の視点①:化合物ライブラリーは「劣化する在庫材料」である
- インシリコ解析(1):ドッキング ― 1億個を計算でふるう
- インシリコ解析(2):構造予測 ― AlphaFold が変えたこと、変えていないこと
- 機械学習と生成AI ― 学習データは探索空間よりはるかに小さい
- 実験の自動化 ― 仮説と実験を回す「ロボット科学者」
- 臨床段階に進んだ例(一次情報で確認できたもの)
- 素材技術者の視点②:AIの候補も「溶けない」で止まる
- 規制当局はAIをどう扱っているか
- 強みと限界
- 用語集/参考資料/出典対応表
事実=公表資料に記載のある内容(出典リンクあり)
本稿の計算=明示した前提をもとに本記事が算出した値
未確定/将来=計画・目標・見通しであり、実績が確認できていない事項
このほか、構造の整理や材料・プロセス設計上の読み取りは「解説」として区別しています。
本記事は探索技術(スクリーニング・計算・自動化)の解説です。個々の薬の効果や安全性を評価するものではなく、医療上の助言でもありません。 臨床試験に触れる箇所は、試験の段階・設計・主要評価項目を一次情報(論文・ClinicalTrials.gov)で確認できた範囲で記載し、 「AIで開発期間が短縮された」といった記述は開発した企業・著者の主張として扱います。
1. AI創薬とスクリーニング(3行でつかむ)
- スクリーニングとは:たくさんの化合物を標的(酵素や受容体など)に当てて、効きそうなもの(ヒット)を拾い出す工程です。実験で行うのがハイスループットスクリーニング(HTS)、計算機の中で行うのがバーチャルスクリーニング(インシリコ解析)です
- AIが入り込んだ場所:標的タンパク質の立体構造の予測(AlphaFold など)、活性の予測(学習モデルで候補に点数をつける)、分子そのものの生成(生成AI)、そして実験の計画と実行の自動化です
- 変わっていないこと:候補は最後に合成して、測って、確かめる必要があります。計算で選べる数が増えるほど、「何を合成し、どう測るか」の比重はむしろ大きくなります(本記事による解説)
AI創薬の論文で目立つのは「何億個から選んだか」ですが、読むべきは「何個作って、何個が本当に効いたか」です。 たとえば深層学習で抗菌物質を探した研究は、約1億735万個を計算で評価し、実験で試したのは23個、活性が確認されたのは8個でした事実。 計算は候補を絞る道具であり、判定は今も実験が下しています。
2. なぜ「探し方」の効率が問われるのか
創薬の研究開発は、長く「投資のわりに成果が増えない」ことが指摘されてきました。 Scannell らは2012年の論文で、次のように述べています事実。
「研究開発に費やした10億米ドルあたりの新薬承認数は、1950年以来およそ9年ごとに半減し、インフレ調整後でおよそ80分の1に落ちた」事実
同論文は、科学・技術・経営の面で効率を上げるはずの進歩が60年間積み重なったにもかかわらずこうなっている、という対比を示し、原因の診断を問い直しています事実。
臨床試験の段階でも、成功は多くありません。Wong らは、2000年1月から2015年10月までの406,038件の臨床試験データ(21,143を超える化合物)を解析し、 開発プログラム全体のうち最終的に承認に至るのは13.8%と推定しています事実。
つまり、臨床に入る前の段階で「筋のよい候補」をどれだけ選べるかが、全体の効率を大きく左右します。 AIやスクリーニング技術への期待は、この一点に集まっています(本記事による解説)。 ただし、AIで臨床での成功率が上がったかどうかは、第9章で見るとおり、まだ一次情報で確かめられる段階にありません未確定/将来。
3. ハイスループットスクリーニング ― 実験で数を当たる
HTSは、化合物ライブラリー(数万〜数百万種の化合物をDMSOなどに溶かしてプレートに並べたもの)を、 ロボットで小さなウェルに分注し、標的との反応を一斉に測る方法です。 米国NIHの化学ゲノミクスセンター(当時)の Inglese らは、2006年に定量的HTS(qHTS)を発表しました事実。
「単一の濃度で化合物を試験する従来のHTSは……頻繁な偽陽性と偽陰性に悩まされ、大がかりな追試を必要とする」事実
qHTSでは、ライブラリーを少なくとも7段階の5倍希釈系列として用意し、およそ4桁の濃度範囲で全化合物の濃度反応曲線を一度に取得します。 ソースプレートの濃度は大半の化合物で640 nM〜10 mMでした事実。
この試験で、qHTSは60,793化合物のうち5,480化合物(9.0%)を活性ありと分類しました事実。 そのうえで著者らは、同じデータを11 µMの1点だけで判定した場合を振り返って比べています。
| 判定のしかた(11 µMの1点) | 偽陽性 | 偽陰性(取りこぼし) |
|---|---|---|
| 平均から3SDを閾値にした場合 | 30化合物(2%) | 845化合物(40%) |
| 平均から6SDを閾値にした場合 | 5化合物(1%) | 1,602化合物(75%) |
すべて事実(Inglese ら 2006[参考資料3])。偽陰性の割合は、qHTSでクラス1・2(良好な曲線)とされた化合物に対する割合です。
著者らは「偽陽性は追試で検出できるが、偽陰性は従来のHTSでは特定できず、その頻度はほとんど知られていない」と指摘しています事実。 また、この酵素アッセイは精度が高かった(Z′=0.87)一方、細胞を使うアッセイなどばらつきの大きい系では、偽陽性が90%に達することもあると述べています事実。 閾値を厳しくすれば偽陽性は減るが、取りこぼしが増える——測定の設計が、そのまま「何を見つけられるか」を決めているということです(本記事による解説)。
4. 素材技術者の視点①:化合物ライブラリーは「劣化する在庫材料」である
HTSの話は「ロボットと計算」に目が行きがちですが、中身は溶液材料の品質管理です。一次情報から、3つの論点が読み取れます。
(1) 保管中に減る。Kozikowski らは、約7,200化合物を20 mMのDMSO溶液として室温で1年保管し、質量分析で追跡しました。 化合物が検出される確率は3か月で92%、6か月で83%、1年で52%でした事実。 ライブラリーは「一度作れば終わり」の資産ではなく、使用期限と保管条件を持つ在庫です(本記事による解説)。
(2) 水溶液の中で「粒子」になって、偽のヒットを出す。Feng と Shoichet は 「マイクロモル濃度では、多くの低分子が自己会合してコロイド状の凝集体を形成し、酵素やその他のタンパク質を非特異的に阻害する」と述べています事実。 その頻度は「30 µMでは『薬らしい』分子の最大19%」「5 µMでも約1〜2%」で、同論文は「多くのHTSキャンペーンがヒット率1%未満を目指していることを考えると、なお大きな割合」だとしています事実。 見分け方は、非イオン性界面活性剤(Triton X-100 を 0.01% vol/vol)を加えると阻害が消えるかどうか。粒子は50〜1,000 nmの範囲で、動的光散乱(DLS)で直接観察できる場合があります事実。
(3) 構造そのものが「測定系に干渉する」ものがある。Baell と Holloway は、多くの生化学HTSで繰り返しヒットとして現れる化合物(PAINS)を見分ける部分構造を報告し、 それらが文献上で有望な出発点として扱われることが増えているが、そうではない可能性があると注意を促しています事実。
「溶けているつもりの分子が、実はナノ粒子の分散液になっていた」——これは、コロイド・界面の技術者にとって最も見慣れた現象のひとつです。 臨界ミセル濃度の考え方、界面活性剤による分散の解除、DLSでの粒径測定は、そのまま創薬スクリーニングの品質管理の道具になっています(本記事による解説)。 そして第7章以降で見るとおり、AIの学習データはこうした実験結果から作られるため、偽陽性はそのまま学習の誤りになります(本記事による解説)。
Lipinski らの論文(2001年に再掲)は、HTSで得られるリード化合物は、HTS以前の時代のリードより分子量と Log P が高く、濁度法で測った溶解度が低い傾向があると記しています事実。 同論文は、経口吸収が悪くなりやすい目安として有名な「5の法則」(水素結合供与基5超、受容基10超、分子量500超、計算 Log P 5超)も示しています事実。 「たくさん当たって強く結合するものを拾う」と、疎水的で溶けにくい分子に偏りやすいということです(本記事による解説)。吸収や溶解度の話は、本シリーズ『薬物動態と前臨床試験』編で詳しく扱います。
5. インシリコ解析(1):ドッキング ― 1億個を計算でふるう
分子ドッキングは、標的タンパク質の立体構造のくぼみ(結合部位)に候補分子を置き、 向きと形を変えながら「どれだけうまくはまるか」を点数化する計算です。 実験のHTSと違い、まだ合成されていない分子も評価できます。
では、候補になりうる分子はどれくらいあるのか。Ruddigkeit らは、C・N・O・S・ハロゲンの原子17個までからなる有機分子を列挙し、 1,664億個を収めたデータベース GDB-17 を作りました。同論文は、この大きさの範囲に多くの医薬品と典型的なリード化合物が含まれるとしています事実。
2019年、Lyu らは、この「広大な空間」の一部を実際にドッキングで調べた結果を報告しました事実。
| 項目 | 論文の記述 |
|---|---|
| ライブラリー | 130の確立した反応と Enamine社の7万種の構成単位(ビルディングブロック)から作る「注文に応じて合成する(make-on-demand)」化合物。他の供給元から市販されているものは3%未満 |
| 規模 | AmpC β-ラクタマーゼに対して9,900万個超、ドーパミンD4受容体に対して1億3,800万個超をドッキング |
| 計算量 | D4では約70兆通りの複合体を評価し、43,563コア時間(1,500コアで約1.2日) |
| 合成と試験 | AmpCでは51個を選び44個(86%)の合成に成功、うち5個が阻害活性(ヒット率11%)。D4では549個を合成・試験 |
| 結果 | D4で81の新しい骨格を発見し、そのうち30がサブマイクロモル。ヒット率はドッキングの点数が良いほど高く、上位では22〜26%、点数が悪くなると単調に下がり、ある点数以下では0 |
すべて事実(Lyu ら 2019[参考資料9])。GDB-17の1,664億個は Ruddigkeit ら 2012[参考資料8]によります。
Lyu らのライブラリーは、「どんな分子がありうるか」ではなく「130の反応と7万種の構成単位で作れる分子」として定義されています事実。 そして実際に、選んだ51個のうち44個(86%)の合成に成功しています事実。
これは材料開発でいえば、「計算で見つけた理想組成」ではなく「手持ちの原料と工程で作れる組成」の中から探すという設計です(本記事による解説)。 探索空間をプロセスの側から定義したからこそ、計算結果がすぐに実物になりました。 マテリアルズ・インフォマティクスで「予測は当たったが作れない」という壁に当たった経験のある技術者には、示唆の大きい設計判断です。
もうひとつ、ヒット率がドッキング点数とともに単調に下がったという結果も重要です事実。 計算の点数は「当たる確率」を並べ替える道具としては機能するが、個々の分子の当否を保証するものではないことを、549個という大きな試験数で示した例として読めます(本記事による解説)。
6. インシリコ解析(2):構造予測 ― AlphaFold が変えたこと、変えていないこと
ドッキングには標的タンパク質の立体構造が要ります。これまでそれは、X線結晶解析などの実験で決めるしかありませんでした。 Jumper らは2021年の論文で、状況をこう述べています事実。
「膨大な実験的努力によって、およそ10万種の固有のタンパク質の構造が決定されてきたが、これは既知の何十億ものタンパク質配列のごく一部にすぎない」事実
AlphaFold は、構造予測の国際的な盲検評価 CASP14 で、主鎖の精度の中央値が0.96 Å(Cα原子の二乗平均平方根偏差、残基の95%で評価)となり、次点の手法は2.8 Åでした事実。
2024年のノーベル化学賞は、半分がデイヴィッド・ベイカーに「計算によるタンパク質設計」で、残り半分がデミス・ハサビスとジョン・ジャンパーに「タンパク質構造予測」で授与されました事実。
発表は、AlphaFold2 によって「研究者が特定してきた約2億種のタンパク質のほぼすべて」の構造が予測できるようになり、190か国の200万人以上に使われていると記しています事実(同発表による記述です)。
2024年の AlphaFold 3 では、タンパク質だけでなく核酸・低分子・イオン・修飾残基を含む複合体の構造を同時に予測できるようになりました。 論文は、タンパク質と低分子の相互作用について、最先端のドッキングツールよりはるかに高い精度を示したとしています事実。 一方で、同じ論文は限界もはっきり書いています。
「タンパク質構造予測モデルの重要な限界は、通常、溶液中の生体分子系の動的なふるまいではなく、PDBに見られるような静的な構造を予測することである」。AlphaFold 3 でもこの限界は残るとしています事実。
立体化学については、正しいキラリティの参照構造を入力として与えても出力がキラリティを守らないことがあり、順位付けに罰則を入れてもベンチマークで4.4%の違反率が観測されたと記しています事実。 また生成型の手法であるため、秩序構造を持たない領域にもっともらしい構造を作り出す「幻覚(hallucination)」が起こりうるとしています事実。
創薬にとっての意味を整理すると、構造予測は「構造がないから計算を始められない」という入口の壁を大きく下げました。 一方で、薬が効くかどうかを左右する「動き」や「水の中での振る舞い」は、依然として予測の外にあります(本記事による解説)。
7. 機械学習と生成AI ― 学習データは探索空間よりはるかに小さい
(1) 学習モデルで「効きそうな順」に並べる
Stokes らは2020年、大腸菌の増殖を抑えるかどうかを予測する深層ニューラルネットワークを作り、新しい抗菌物質を探しました事実。 流れは3段階です。①実験データで学習 → ②巨大なライブラリーを予測で並べ替え → ③上位を実験で確かめる。
| 段階 | 論文の記述 |
|---|---|
| 学習データ | FDA承認薬などと天然物を合わせた2,335種(重複除去後)。増殖を80%以上抑えたものをヒットとし、120種(5.14%)がヒット |
| 予測の対象 | Drug Repurposing Hub の6,111種、WuXi の抗結核ライブラリー9,997種、ZINC15データベースから選んだ107,349,233種 |
| 計算時間 | 約1億735万種の予測は4日で実行できた |
| 実験での確認 | ZINC15からの予測のうち23種を試験し、8種が抗菌活性。既知の抗生物質とは構造的に離れていた |
| 成果の例 | Drug Repurposing Hub から見つかったハリシンは、マウスの感染モデルで効果を示した |
すべて事実(Stokes ら 2020[参考資料13])。ハリシンは研究段階の化合物であり、本記事は治療上の意味を評価していません。
(2) 生成AIで「分子そのもの」を作らせる
並べ替えではなく、条件を満たす分子の構造を新たに生成するのが生成AIです。 Zhavoronkov らは2019年、深層生成モデル GENTRL で「合成のしやすさ、新規性、生物活性」を最適化し、 キナーゼ DDR1 の阻害剤を21日で見いだしたと報告しました。4化合物が生化学アッセイで活性を示し、2化合物が細胞アッセイで確認され、1化合物はマウスで良好な薬物動態を示したとしています事実。
「21日」は著者らが報告した設計段階の期間であり、その後の合成・評価・開発全体の期間を示すものではありません(本記事による解説)。
8. 実験の自動化 ― 仮説と実験を回す「ロボット科学者」
計算で候補を絞っても、確かめるのは実験です。そこで実験の計画・実行・解析をひとつのループにする試みがあります。 Williams らは2015年、ロボット科学者「Eve」を報告しました事実。
「ロボット科学者とは、人工知能(AI)の手法を用いて、実験のサイクルを通じて科学的知識を発見する実験室自動化システムである」。 Eve はライブラリーのスクリーニング、ヒットの確認、リードの創出を統合・自動化し、定量的構造活性相関(QSAR)の学習と試験のサイクルを回します事実。
装置は「1日1万化合物を超える」程度の中〜高スループットで、蛍光・吸光度・細胞形態を読み出しに使えるよう構成を変えられます。 約14,400化合物のライブラリーを複数の寄生虫由来の酵素(DHFR)に当て、抗がん化合物 TNP-470 が三日熱マラリア原虫の DHFR の強い阻害剤であることを見いだしたと報告しています事実。
著者らは経済モデルを使い、AIで化合物を選ぶ方式が、標準的な総当たりスクリーニングより経済的に優れることを示したとしています事実(著者らのモデルによる評価です)。
ここでいう「経済的に優れる」は、全化合物を測る代わりに、学習しながら次に測る化合物を選ぶことで、測定数を減らせるという意味です(本記事による解説)。 第3章のqHTSが「全部を丁寧に測る」方向の進化だったとすれば、Eve は「測る順番を賢くする」方向の進化です。両者は対立するものではなく、どちらも測定の質がループ全体の質を決める点で共通しています。
9. 臨床段階に進んだ例(一次情報で確認できたもの)
「AIで見つけた薬」が臨床試験に進んだという発表は増えていますが、ここでは査読論文と ClinicalTrials.gov の登録で段階を確認できたものに限って記載します。
| 候補 | AIの関与(論文の記述) | 臨床段階(一次情報) |
|---|---|---|
| rentosertib (旧名 ISM001-055/INS018_055) 標的:TNIK | AIの標的探索基盤(PandaOmics)で線維化の標的として TNIK を選び、生成AIの設計基盤(Chemistry42)で阻害剤を設計。Chemistry42 は30の生成モデルを並行して使ったとされる | 第1相:健康成人78人を対象とした無作為化二重盲検プラセボ対照試験(NCT05154240、完了) 第2a相:特発性肺線維症の患者71人、中国の21施設、12週間、プラセボ対照(NCT05938920、完了) |
すべて事実(Ren ら 2024[参考資料16]、Xu ら 2025[参考資料17]、ClinicalTrials.gov[参考資料18・19])。本記事の調査時点で、この化合物が規制当局に承認されたことを示す一次情報は確認できませんでした未確定/将来。
設計:特発性肺線維症の成人を、rentosertib 30 mg 1日1回(18人)、30 mg 1日2回(18人)、60 mg 1日1回(18人)、プラセボ(17人)の4群に無作為に割り付け、12週間投与しました事実。
主要評価項目:少なくとも1件の治験薬投与後の有害事象が起きた患者の割合(安全性・忍容性の評価)で、各群で同程度だったと報告されています事実。肺機能(努力肺活量)の変化は副次評価項目として報告されています事実。
著者ら自身の留保:試験期間が短く、全群で71人中16人(22.5%)が脱落したことを挙げ、より大規模で長期の第2相または第3相試験が必要だとしています事実。
本記事は、この試験の有効性や安全性を評価するものではありません。
Ren らの論文は、標的の発見から前臨床候補の指名までを「およそ18か月」で完了したと述べています事実。これは開発した企業の研究者自身による報告であり、比較対象となる同条件の従来型開発と並べて検証されたものではありません(本記事による解説)。
また Jayatunga らは、AIを中核とするバイオテック企業の臨床パイプラインを分析し、AIで見いだされた分子の第1相の成功率を80〜90%、第2相を約40%(標本数は限られる)と報告しています事実。 著者ら自身が第2相について標本の少なさを明記しており、AIによって臨床での成功率が上がったと結論できる段階ではありません未確定/将来。
10. 素材技術者の視点②:AIの候補も「溶けない」で止まる
第9章の rentosertib の論文には、見落とされやすいが重要な一節があります。 生成AIで設計し、合成した最初のリード化合物群は、ナノモル級の結合親和性を示しました。ところが——
「一次リード化合物の in vitro 吸収・分布・代謝・排泄(ADME)プロファイリングでは、ヒトおよびマウスの肝ミクロソームでのクリアランスが高く、シトクロムP450の阻害(IC50 10 µM未満)があり、速度論的溶解度が2 µM未満であった」事実
そこでリード最適化の段階でADMEの改善を優先し、その結果得られたのが候補化合物だった、と記されています事実。
溶解度2 µM未満という数字は、第4章の「5 µMでも1〜2%の分子が凝集体になる」という話と同じ桁にあります事実。 つまりAIが「よく結合する」形を見つけても、その分子が水にどれだけ溶け、代謝でどれだけ速く消えるかは別の問題として残り、 それを確かめたのは肝ミクロソームと溶解度の実測でした(本記事による解説)。
材料開発に置き換えると、「目的の機能(結合)は計算で当てられるが、加工性・安定性(溶解・代謝)は実測で詰める」という構図です。 マテリアルズ・インフォマティクスでも、主機能の予測より、副次的な物性の同時最適化のほうが難しいと感じる場面は多いはずです。 創薬でも同じ壁がある、ということが一次情報から読み取れます(本記事による解説)。 ADMEの試験法については、本シリーズ『薬物動態と前臨床試験』編で詳しく扱います。
11. 規制当局はAIをどう扱っているか
FDAは2025年1月6日、医薬品・生物製剤の開発でAIを使う際の考え方を示すドラフトガイダンスを公表しました。 発表は、これが「医薬品・生物製剤の開発におけるAIの使用について、当局が出した最初のガイダンス」であり、FDAは2016年以降、AIの要素を含む500件を超える申請を審査してきたと記しています事実。
対象:安全性・有効性・品質に関する規制上の判断を支える情報やデータを、AIモデルで作り出す場合事実。
対象外:「このガイダンスは、AIモデルの使用のうち、(1) 創薬(drug discovery)における使用、または (2) 患者の安全、医薬品の品質、非臨床・臨床試験の結果の信頼性に影響しない業務効率化での使用は扱わない」事実
枠組み:リスクにもとづく7段階の信頼性評価(①問いの定義 → ②使用の文脈(COU)の定義 → ③モデルリスクの評価 → ④信頼性確立の計画 → ⑤実行 → ⑥結果の文書化 → ⑦COUに対する妥当性の判断)。 モデルリスクは「モデルの影響度」と「判断を誤った場合の帰結の重大さ」の組み合わせとされています事実。
製造の例:多回投与バイアルの注射剤で、充填量の100%自動外観検査にAI画像解析を使う場合が例示されています事実。
2026年1月14日には、EMAとFDAが共同で「医薬品開発における良好なAI実践の指導原則」として10の原則を公表しました。 対象は非臨床・臨床・市販後・製造の各段階でのエビデンスの生成と分析で、データの出所・処理・分析上の判断を追跡可能な形で文書化すること(原則6)や、定期的な監視と再評価でデータのドリフトに対応すること(原則9)が含まれます事実。 同文書は、AIがヒトでの毒性・有効性の予測を改善することで、動物試験への依存を減らすことにも期待を示しています事実。
ガイダンスが創薬段階のAIを対象外にしていることは、裏返せば、規制上の判断に使われるのは、その後の非臨床・臨床・製造で得られるデータだということです(本記事による解説)。 AIで選んだ候補も、最後は同じ試験で評価される。だから探索段階のAIは、規制ではなく「後段の試験を通る候補を出せるか」で評価されます。
一方、製造の例として充填量の自動外観検査が挙がっているように、AIが品質判定そのものに入る場面では、使用の文脈とリスクに応じた検証が求められます事実。 検査装置や計測機器を医薬品製造に納める立場の技術者にとっては、「そのAIが何の判断に、どれだけの重みで使われるか」を先に定義するという考え方は、そのまま設計仕様の書き方になります(本記事による解説)。 GMPの枠組みは本シリーズ『GMP』編で扱っています。
12. 強みと限界
| 技術 | 一次情報で確認できた強み | 一次情報で確認できた限界 |
|---|---|---|
| qHTS(実験) | 全化合物の濃度反応曲線が得られ、単一濃度HTSの取りこぼしを避けられる | ライブラリーの劣化、凝集体・干渉化合物による偽陽性 |
| ドッキング | 未合成の分子を1億個規模で評価できる。点数が良いほどヒット率が高い | 点数は確率の並べ替えにとどまり、ある点数以下ではヒット率0 |
| 構造予測 | 実験構造がない標的でも計算を始められる。複合体の予測も可能に | 静的構造しか出ない、立体化学の誤り、無秩序領域の幻覚 |
| 学習・生成モデル | 学習データの数万倍の空間を短期間で並べ替え・生成できる | 学習データは小さく、実験の質に依存する。ADME・溶解度は別途実測が要る |
| 自動化 | 測る順番を学習で決め、測定数を減らせる | 読み出しの種類や対象の組み替えに、装置側の柔軟性が要る |
各項目は第3〜10章で引用した一次情報[参考資料3〜17]の記述にもとづきます事実。5つの技術に分けて整理したのは本記事によるものです。
(1) AIで臨床の成功率が上がったかは、まだ分からない
第9章で見たとおり、査読論文と試験登録で確認できる臨床段階の例はまだ限られ、承認に至った例も本稿の調査時点では確認できませんでした。 AIによって開発全体の成功率や期間が改善したかどうかは、今後のデータで判断されるべき事項です未確定/将来。
(2) 開発費・期間の「短縮効果」の数字は記載していない
企業の発表には期間や費用の短縮をうたうものがありますが、同じ条件の比較対照がある一次情報を確認できなかったため、本記事では数字として扱っていません。 Ren らの「およそ18か月」は、著者ら自身の報告として引用するにとどめています。
- qHTSは6万個を濃度系列で30時間で測り切りました。1点判定では良好な活性化合物の40%を取りこぼしていました事実
- 30 µMでは「薬らしい」分子の最大19%がコロイド凝集体になります。ヒットの質は溶液物性で決まります事実
- ドッキングは1億3,800万個を1分子あたり約1.1コア秒で評価しました。実際に作って試したのは約25万分の1です本稿の計算
- AlphaFoldは構造がない壁を下げましたが、動き・立体化学・幻覚という限界を論文自身が挙げています事実
- AIの候補も、溶解度2 µM未満・高いクリアランスで一度は止まりました。最後は実測が決めています事実
- FDAのドラフトガイダンスは創薬段階のAIを対象外とし、規制上の判断に使う場面を対象にしています事実
13. 用語集
- スクリーニング
- 多数の化合物を標的に当て、活性のあるもの(ヒット)を拾い出す工程。
- HTS
- ハイスループットスクリーニング。ロボットで多数のウェルを一斉に測る実験手法。
- qHTS
- 定量的HTS。全化合物を濃度系列で測り、濃度反応曲線を得る方式。
- 化合物ライブラリー
- スクリーニング用に多数の化合物を溶液にしてプレートに並べたもの。
- 偽陽性/偽陰性
- 本当は活性がないのにヒットとされる誤り/活性があるのに見逃す誤り。
- コロイド凝集体
- 低分子が水中で自己会合してできる粒子。タンパク質を非特異的に阻害する。
- PAINS
- 多くの測定系で繰り返しヒットとして現れる、干渉しやすい部分構造をもつ化合物。
- 5の法則
- 分子量・Log P・水素結合の数から、経口吸収が悪くなりやすい分子の目安を示したもの。
- インシリコ
- 計算機の中で行う解析。実験(in vitro、in vivo)と対比して使う。
- ドッキング
- 標的の結合部位に候補分子を置き、はまり具合を点数化する計算。
- make-on-demand
- 注文を受けてから合成する前提で、反応と構成単位から列挙した化合物群。
- AlphaFold
- アミノ酸配列などからタンパク質の立体構造を予測するAIモデル。
- 生成AI(分子生成)
- 条件を満たす分子の構造を新たに作り出すモデル。
- QSAR
- 定量的構造活性相関。分子の構造と活性の関係を数式やモデルで表すもの。
- ADME
- 吸収・分布・代謝・排泄。体内での薬の動きを表す4つの過程。
- 使用の文脈(COU)
- AIモデルがどの問いに、どんな役割と範囲で使われるかの定義。
14. 参考資料(一次情報)
- Scannell, J.W., Blanckley, A., Boldon, H., Warrington, B.「Diagnosing the decline in pharmaceutical R&D efficiency」Nature Reviews Drug Discovery 11(3), 191–200 (2012). doi:10.1038/nrd3681 — pubmed.ncbi.nlm.nih.gov
- Wong, C.H., Siah, K.W., Lo, A.W.「Estimation of clinical trial success rates and related parameters」Biostatistics 20(2), 273–286 (2019). doi:10.1093/biostatistics/kxx069 — pmc.ncbi.nlm.nih.gov
- Inglese, J. ほか「Quantitative high-throughput screening: A titration-based approach that efficiently identifies biological activities in large chemical libraries」PNAS 103(31), 11473–11478 (2006). doi:10.1073/pnas.0604348103 — pmc.ncbi.nlm.nih.gov
- Kozikowski, B.A. ほか「The effect of room-temperature storage on the stability of compounds in DMSO」Journal of Biomolecular Screening 8(2), 205–209 (2003). doi:10.1177/1087057103252617 — pubmed.ncbi.nlm.nih.gov
- Feng, B.Y., Shoichet, B.K.「A detergent-based assay for the detection of promiscuous inhibitors」Nature Protocols 1(2), 550–553 (2006). doi:10.1038/nprot.2006.77 — pmc.ncbi.nlm.nih.gov
- Baell, J.B., Holloway, G.A.「New substructure filters for removal of pan assay interference compounds (PAINS) from screening libraries and for their exclusion in bioassays」Journal of Medicinal Chemistry 53(7), 2719–2740 (2010). doi:10.1021/jm901137j — pubmed.ncbi.nlm.nih.gov
- Lipinski, C.A., Lombardo, F., Dominy, B.W., Feeney, P.J.「Experimental and computational approaches to estimate solubility and permeability in drug discovery and development settings」Advanced Drug Delivery Reviews 46(1-3), 3–26 (2001). doi:10.1016/S0169-409X(00)00129-0 — pubmed.ncbi.nlm.nih.gov
- Ruddigkeit, L., van Deursen, R., Blum, L.C., Reymond, J.-L.「Enumeration of 166 billion organic small molecules in the chemical universe database GDB-17」Journal of Chemical Information and Modeling 52(11), 2864–2875 (2012). doi:10.1021/ci300415d — pubmed.ncbi.nlm.nih.gov
- Lyu, J. ほか「Ultra-large library docking for discovering new chemotypes」Nature 566, 224–229 (2019). doi:10.1038/s41586-019-0917-9 — pmc.ncbi.nlm.nih.gov
- Jumper, J. ほか「Highly accurate protein structure prediction with AlphaFold」Nature 596, 583–589 (2021). doi:10.1038/s41586-021-03819-2 — pmc.ncbi.nlm.nih.gov
- Abramson, J. ほか「Accurate structure prediction of biomolecular interactions with AlphaFold 3」Nature 630, 493–500 (2024). doi:10.1038/s41586-024-07487-w — pmc.ncbi.nlm.nih.gov
- The Royal Swedish Academy of Sciences「The Nobel Prize in Chemistry 2024 — Press release」2024年10月9日 — nobelprize.org
- Stokes, J.M. ほか「A deep learning approach to antibiotic discovery」Cell 180(4), 688–702 (2020). doi:10.1016/j.cell.2020.01.021 — pmc.ncbi.nlm.nih.gov
- Zhavoronkov, A. ほか「Deep learning enables rapid identification of potent DDR1 kinase inhibitors」Nature Biotechnology 37(9), 1038–1040 (2019). doi:10.1038/s41587-019-0224-x — pubmed.ncbi.nlm.nih.gov
- Williams, K. ほか「Cheaper faster drug development validated by the repositioning of drugs against neglected tropical diseases」Journal of the Royal Society Interface 12(104), 20141289 (2015). doi:10.1098/rsif.2014.1289 — pmc.ncbi.nlm.nih.gov
- Ren, F. ほか「A small-molecule TNIK inhibitor targets fibrosis in preclinical and clinical models」Nature Biotechnology 43(1), 63–75 (2025、オンライン公開2024年3月). doi:10.1038/s41587-024-02143-0 — pmc.ncbi.nlm.nih.gov
- Xu, Z. ほか「A generative AI-discovered TNIK inhibitor for idiopathic pulmonary fibrosis: a randomized phase 2a trial」Nature Medicine 31(8), 2602–2610 (2025). doi:10.1038/s41591-025-03743-2 — pmc.ncbi.nlm.nih.gov
- ClinicalTrials.gov「A Phase 1, Evaluate the Safety, Tolerability, and Pharmacokinetics of INS018_055 in Healthy Subjects」NCT05154240 — clinicaltrials.gov
- ClinicalTrials.gov「Study Evaluating INS018_055 Administered Orally to Subjects With Idiopathic Pulmonary Fibrosis (IPF)」NCT05938920 — clinicaltrials.gov
- Jayatunga, M.K.P., Ayers, M., Bruens, L., Jayanth, D., Meier, C.「How successful are AI-discovered drugs in clinical trials? A first analysis and emerging lessons」Drug Discovery Today 29(6), 104009 (2024). doi:10.1016/j.drudis.2024.104009 — pubmed.ncbi.nlm.nih.gov
- FDA「FDA Proposes Framework to Advance Credibility of AI Models Used for Drug and Biological Product Submissions」2025年1月6日 — fda.gov
- FDA「Considerations for the Use of Artificial Intelligence to Support Regulatory Decision-Making for Drug and Biological Products — Draft Guidance」2025年1月(PDF) — fda.gov
- EMA・FDA「Guiding principles of good AI practice in drug development」2026年1月(PDF) — ema.europa.eu
- European Medicines Agency「EMA and FDA set common principles for AI in medicine development」2026年1月14日 — ema.europa.eu
15. 主張と出典の対応表(監査)
| 本文の主張 | 根拠 | 区分 |
|---|---|---|
| 研究開発費10億米ドルあたりの新薬承認数が1950年以来およそ9年ごとに半減し、インフレ調整後でおよそ80分の1に落ちたこと。60年間の科学・技術・経営面の進歩との対比で原因の診断を問い直していること | Scannell ら(2012)要旨[参考資料 1]https://pubmed.ncbi.nlm.nih.gov/22378269/ | 事実 |
| 2000年1月〜2015年10月の406,038件の臨床試験データ(21,143を超える化合物)を解析し、開発プログラムの13.8%が最終的に承認に至ると推定したこと | Wong ら(2019)[参考資料 2]https://pmc.ncbi.nlm.nih.gov/articles/PMC6409418/ | 事実 |
| 単一濃度の従来HTSが頻繁な偽陽性・偽陰性に悩まされ大がかりな追試を要すること。少なくとも7段階の5倍希釈系列で約4桁の濃度範囲、ソース濃度が大半で640 nM〜10 mMであること。1,536穴プレート、23 nLのピン転写。60,793化合物、368枚・565,248ウェルを連続30時間で測定したこと。5,480化合物(9.0%)を活性ありと分類したこと。11 µMの1点判定で3SD閾値なら偽陽性30(2%)・偽陰性845(40%)、6SD閾値なら偽陽性5(1%)・偽陰性1,602(75%)であったこと。偽陰性は従来HTSでは特定できず頻度がほとんど知られていないこと。Z′が0.87であったこと、細胞系などばらつきの大きいアッセイでは偽陽性が90%に達しうること | Inglese ら(2006)[参考資料 3]https://pmc.ncbi.nlm.nih.gov/articles/PMC1518803/ | 事実 |
| 約7,200化合物を20 mMのDMSO溶液として室温で1年保管し、検出確率が3か月で92%・6か月で83%・1年で52%であったこと | Kozikowski ら(2003)要旨[参考資料 4]https://pubmed.ncbi.nlm.nih.gov/12844442/ | 事実 |
| マイクロモル濃度で多くの低分子が自己会合してコロイド凝集体を作り非特異的に阻害すること。30 µMで「薬らしい」分子の最大19%、5 µMで約1〜2%が凝集し、ヒット率1%未満を目指すHTSにとって大きな割合であること。0.01% vol/vol Triton X-100 による判別、50〜1,000 nmの粒子をDLSで観察しうること | Feng と Shoichet(2006)[参考資料 5]https://pmc.ncbi.nlm.nih.gov/articles/PMC1544377/ | 事実 |
| 多くの生化学HTSで繰り返しヒットとなる化合物(PAINS)を見分ける部分構造を報告し、それらが有望な出発点として扱われることが増えているがそうでない可能性があると述べたこと | Baell と Holloway(2010)要旨[参考資料 6]https://pubmed.ncbi.nlm.nih.gov/20131845/ | 事実 |
| 「5の法則」(水素結合供与基5超、受容基10超、分子量500超、CLogP 5超で吸収・透過が悪くなりやすい)。HTSのリードはHTS以前のリードより分子量とLog Pが高く濁度法の溶解度が低い傾向があること | Lipinski ら(2001)要旨[参考資料 7]https://pubmed.ncbi.nlm.nih.gov/11259830/ | 事実 |
| C・N・O・S・ハロゲンの原子17個までの分子1,664億個(166.4 billion)を列挙したGDB-17であり、多くの医薬品と典型的なリードを含む大きさの範囲であること | Ruddigkeit ら(2012)要旨[参考資料 8]https://pubmed.ncbi.nlm.nih.gov/23088335/ | 事実 |
| 130の反応とEnamineの7万種の構成単位によるmake-on-demandライブラリーで、他の供給元から市販されているのは3%未満であること。AmpCに9,900万個超、D4受容体に1億3,800万個超をドッキングしたこと。D4で約70兆の複合体を評価し43,563コア時間(1,500コアで約1.2日)を要したこと。AmpCで51個中44個(86%)の合成に成功し5個が阻害(ヒット率11%)、D4で549個を試験したこと。81の新しい骨格を発見し30がサブマイクロモルであったこと。ヒット率が上位で22〜26%、点数の悪化とともに単調に下がり、ある点数以下で0となったこと | Lyu ら(2019)[参考資料 9]https://pmc.ncbi.nlm.nih.gov/articles/PMC6383769/ | 事実 |
| 実験で決定された固有タンパク質の構造がおよそ10万種で、既知配列のごく一部にすぎないこと。CASP14で主鎖精度の中央値が0.96 Å、次点が2.8 Åであったこと | Jumper ら(2021)[参考資料 10]https://pmc.ncbi.nlm.nih.gov/articles/PMC8371605/ | 事実 |
| AlphaFold 3 がタンパク質・核酸・低分子・イオン・修飾残基を含む複合体を予測し、拡散モジュールで原子座標を直接扱うこと、タンパク質–低分子相互作用で最先端のドッキングツールよりはるかに高い精度を示したとすること。静的構造しか予測せず溶液中の動的挙動を再現しない限界が残ること、キラリティ違反率4.4%、秩序のない領域での幻覚 | Abramson ら(2024)[参考資料 11]https://pmc.ncbi.nlm.nih.gov/articles/PMC11168924/ | 事実 |
| 2024年ノーベル化学賞が半分をベイカーに「計算によるタンパク質設計」、残り半分をハサビスとジャンパーに「タンパク質構造予測」で授与されたこと、発表日2024年10月9日。AlphaFold2 で約2億種のタンパク質のほぼすべての構造が予測でき、190か国の200万人以上に使われていること | ノーベル財団 プレスリリース[参考資料 12]https://www.nobelprize.org/prizes/chemistry/2024/press-release/ | 事実 |
| 学習データ2,335種(120種・5.14%がヒット)、予測対象がDrug Repurposing Hub 6,111種・WuXi 9,997種・ZINC15から107,349,233種、その予測を4日で実行、ZINC15の予測から23種を試験し8種が抗菌活性で既知抗生物質と構造的に離れていたこと、ハリシンがマウス感染モデルで効果を示したこと | Stokes ら(2020)[参考資料 13]https://pmc.ncbi.nlm.nih.gov/articles/PMC8349178/ | 事実 |
| GENTRLが合成のしやすさ・新規性・生物活性を最適化し、DDR1阻害剤を21日で見いだしたこと、4化合物が生化学アッセイで活性、2化合物が細胞アッセイで確認、1化合物がマウスで良好な薬物動態を示したこと | Zhavoronkov ら(2019)要旨[参考資料 14]https://pubmed.ncbi.nlm.nih.gov/31477924/ | 事実 |
| ロボット科学者の定義、Eveがライブラリースクリーニング・ヒット確認・リード創出を統合しQSARの学習と試験のサイクルを回すこと、1日1万化合物超、読み出しの切り替え、約14,400化合物のライブラリー、TNP-470が三日熱マラリア原虫DHFRの強い阻害剤であることの発見、経済モデルでAIによる選択が標準スクリーニングより経済的に優れると示したこと | Williams ら(2015)[参考資料 15]https://pmc.ncbi.nlm.nih.gov/articles/PMC4345494/ | 事実 |
| PandaOmicsでTNIKを標的とし、Chemistry42(30の生成モデルを並行使用)で阻害剤を設計したこと。一次リードがナノモル級の結合親和性を示したが、ヒト・マウス肝ミクロソームでの高いクリアランス、CYP阻害(IC50 10 µM未満)、速度論的溶解度2 µM未満であり、リード最適化でADME改善を優先したこと。第1相(NCT05154240)が健康成人78人の無作為化二重盲検プラセボ対照試験であること。標的発見から前臨床候補指名までおよそ18か月で完了したとする記述 | Ren ら(2024)[参考資料 16]https://pmc.ncbi.nlm.nih.gov/articles/PMC11738990/ | 事実 |
| 第2a相試験が特発性肺線維症の成人71人を30 mg 1日1回(18人)・30 mg 1日2回(18人)・60 mg 1日1回(18人)・プラセボ(17人)に割り付け12週間投与した多施設(中国21施設)二重盲検無作為化試験であること、主要評価項目が治験薬投与後の有害事象が1件以上起きた患者の割合で各群同程度だったこと、努力肺活量の変化が副次評価項目であること、71人中16人(22.5%)が脱落したこと、より大規模で長期の試験が必要とされていること | Xu ら(2025)[参考資料 17]https://pmc.ncbi.nlm.nih.gov/articles/PMC12353801/ | 事実 |
| NCT05154240 が INS018_055 の健康成人を対象とする第1相試験で、登録78人(実績)、状況が完了であること | ClinicalTrials.gov[参考資料 18]https://clinicaltrials.gov/study/NCT05154240 | 事実 |
| NCT05938920 が特発性肺線維症を対象とする第2a相試験で、登録71人(実績)、状況が完了であること | ClinicalTrials.gov[参考資料 19]https://clinicaltrials.gov/study/NCT05938920 | 事実 |
| AIで見いだされた分子の第1相成功率を80〜90%、第2相を約40%(標本数は限られる)と報告したこと | Jayatunga ら(2024)要旨[参考資料 20]https://pubmed.ncbi.nlm.nih.gov/38692505/ | 事実 |
| FDAが2025年1月6日にドラフトガイダンスを公表したこと、それが医薬品・生物製剤開発でのAI使用に関する最初のガイダンスであること、2016年以降AIの要素を含む500件超の申請を審査してきたこと | FDA プレスリリース[参考資料 21]https://www.fda.gov/news-events/press-announcements/fda-proposes-framework-advance-credibility-ai-models-used-drug-and-biological-product-submissions | 事実 |
| ガイダンスの対象(安全性・有効性・品質の規制上の判断を支えるデータをAIで作る場合)と対象外(創薬、影響のない業務効率化)。7段階の信頼性評価。モデルリスクがモデルの影響度と判断の帰結の組み合わせであること。臨床での患者層別化の例と、多回投与バイアルの充填量をAI画像解析で100%自動検査する製造の例。2025年1月付のドラフトであること | FDA ドラフトガイダンス(PDF)[参考資料 22]https://www.fda.gov/media/184830/download | 事実 |
| EMAとFDAの10の指導原則が非臨床・臨床・市販後・製造の各段階のエビデンスを対象とすること、原則6(データの出所・処理・分析判断の追跡可能な文書化)、原則9(定期的な監視と再評価、データのドリフトへの対応)、AIによる毒性・有効性予測の改善で動物試験への依存を減らすことへの期待 | EMA・FDA 指導原則(PDF)[参考資料 23]https://www.ema.europa.eu/en/documents/other/guiding-principles-good-ai-practice-drug-development_en.pdf | 事実 |
| EMAとFDAが2026年1月14日に10の原則を共同で公表したこと | EMA ニュース[参考資料 24]https://www.ema.europa.eu/en/news/ema-fda-set-common-principles-ai-medicine-development-0 | 事実 |
| 565,248 ÷ 30時間 = 約18,800ウェル/時(約5ウェル/秒)、565,248 ÷ 60,793 = 約9.3ウェル/化合物。43,563コア時間 ÷ 1億3,800万 = 約1.1コア秒/分子、549 ÷ 1億3,800万 = 約25万分の1。107,349,233 ÷ 2,335 = 約4.6万倍、8 ÷ 23 = 約35%。図2・図4の棒の長さ(個数の常用対数に比例) | 本稿の計算。論文の公表値を単純に除算したものであり、装置の実効能力・計算の一般的な速度・モデル全体の的中率を示すものではない | 本稿の計算 |
| AIによって臨床での成功率や開発期間が改善したかどうか。rentosertib の承認の有無 | 本稿の調査時点(2026年9月)で、同条件の比較にもとづく一次情報や承認を示す一次情報は確認できなかった | 未確定/将来 |
| AI創薬企業が発表する期間・費用の短縮効果の数値、個々の企業の開発パイプライン全体 | 比較対照のある一次情報を確認できなかったため記載していない。臨床段階の例は査読論文とClinicalTrials.govで確認できたものに限った | 解説 |
| ライブラリーを「使用期限のある在庫材料」、凝集体を「コロイド分散」と読む整理。閾値と取りこぼしの関係の読み取り。make-on-demandを「プロセス側から定義した探索空間」とする読み取り。ドッキング点数を確率の並べ替えとする整理。構造予測の意味の整理。Eveを「測る順番を賢くする」方向と位置づけたこと。溶解度・ADMEを副次物性の同時最適化になぞらえたこと。規制が「AIの出力が使われる場面」を見ているという読み取り。第12章の5技術への整理 | 公表内容にもとづく本記事の整理・解説。各論文の著者や規制当局が表明した見解ではない | 解説 |
| 各候補化合物の効能・効果、臨床成績、安全性の評価 | 本記事は探索技術の解説であり、治療効果や安全性の評価は行っていない。第2a相試験は設計・主要評価項目・著者の留保のみを記載した | 解説 |
| 図1〜図4・図6が実際の装置・構造・データの図ではなく説明のための作図であること。ヒーロー画像と図5がAI生成イメージであること | 本記事による注記 | 解説 |
最終更新:2026年9月26日/出典は一次情報(査読論文、ノーベル財団の発表、ClinicalTrials.gov、FDA・EMAの公表文書)に限定しています。 スクリーニングや計算の設計上の読み取りを含むため、それらは「解説」として出典付きの事実と区別しています。 AIによる開発期間・費用の短縮効果の数値、臨床成功率の改善、候補化合物の承認については、比較対照のある一次情報または承認を示す一次情報を確認できなかったため記載していません。 FDAのガイダンスは2025年1月時点のドラフトです。 本記事は探索技術の解説であり、治療の効果・安全性を評価するものではなく、医療上の助言でもありません。 図はすべて説明用の概念図です。図1〜図4・図6はベクター作図、ヒーロー画像と図5はAI生成イメージであり、いずれも実際の装置・分子・データを示すものではありません。