ローカルLLMとクラウドAIの費用比較は、機器の購入額と従量単価ではなく、同じサービス水準のTCO(総保有費用)で判断します。業務量、品質、可用性、期間をそろえ、設備、電力、保守、API、監視、データ移行、撤退までを計上します。本稿は36か月の想定例を使い、実測値、公表仕様、仮定単価を分けて再計算できる形にします。
ローカルLLMとクラウドAIは同じサービス水準で比べる
価格表を開く前に、月間要求数、入力・出力トークン、同時利用、稼働時間、応答時間、品質、データ制約を一枚にします。ローカルだけ小型モデル、クラウドだけ高性能モデルを使って費用を比べると、安さではなく提供品質の差を計算してしまいます。まず同一条件のローカルLLM評価で合格した構成と、同じ120ケースを通したクラウド候補を残します。
本稿の想定企業は、社内規程QAと文書要約に月20,000要求を使い、1要求あたり入力1,500、出力300トークンとします。月間では入力3,000万、出力600万トークンです。営業時間は平日12時間、目標可用性は99.5%、同時利用は通常3・最大8、ログは90日保持、検討期間は36か月です。この量は実績ではないため、自社の2〜4週間の計測値へ置き換えます。
| 項目 | 想定値 | 実測時の取り方 |
|---|---|---|
| 月間処理量 | 20,000要求、入力3,000万、出力600万トークン | 試行ログから成功・再試行・失敗を別集計 |
| 性能 | 完了時間p95が20秒以内 | 短文・標準・長文を分けてAPI端点で計測 |
| 品質 | 固定120ケースで合格85%以上、重大誤り0 | 人の確定採点を同じ版で比較 |
| 可用性 | 営業時間の99.5% | 計画停止と障害停止の定義を固定 |
| データ | 機密区分2まで、国内拠点から利用 | 送信先、保存、学習利用、削除条件を確認 |
| 期間 | 36か月 | 更新・償却・契約期間を同じ月数へ統一 |
処理量は成功要求だけでなく、再生成、評価、開発、監視用の試験も含めます。業務要求20,000件に対し、再試行5%、開発・回帰試験10%なら請求対象は20,000×1.15=23,000要求相当です。逆にローカル側で評価用負荷を無視すれば、必要GPUや電力を小さく見積もります。入力長の平均だけでなくp95を確認し、KVキャッシュと同時実行の設計へ反映します。
ローカル、クラウドGPU、APIの費用構造
ローカルLLMは初期固定費が大きく、要求が増えたときの追加推論費は小さく見えます。ただし容量上限を超えるとGPU増設が段階的に発生します。クラウドGPUは時間単価で容量を借りられ、停止すれば計算資源の費用を抑えられますが、24時間起動やストレージ、通信、運用サービスは積み上がります。生成AI APIは入力・出力などの従量が中心で、モデル運用を委ねられる一方、単価改定、モデル廃止、データ処理条件への対応が必要です。
| 形態 | 主な固定費 | 主な変動費 | 見落としやすい項目 |
|---|---|---|---|
| 社内ローカル | GPU端末、設置、保証、予備機、初期構築 | 電力、保守時間、部品交換 | 夜間障害、冷却、更新検証、資産廃棄 |
| クラウドGPU | 基盤設計、イメージ、ネットワーク、監視 | インスタンス時間、ディスク、転送 | 停止忘れ、起動待ち、最低稼働、冗長化 |
| 生成AI API | 接続開発、ガードレール、監査設計 | 入力・出力・キャッシュ・ツール利用 | 再試行、長いシステム指示、評価トラフィック |
NVIDIA公式のL4製品ページ(2026年7月30日確認)は、GPUメモリ24GB、最大消費電力72Wなどの仕様を掲載しています[1]。これはGPU単体の仕様で、端末の平均消費電力や処理能力を示す実測値ではありません。ホストCPU、RAM、SSD、電源損失、アイドル時間を含む壁コンセント側の電力は、候補機を業務負荷で動かして測ります。
AWS公式のG6インスタンス説明(2026年7月30日確認)は、NVIDIA L4を搭載し、GPUあたり24GBのメモリを提供する構成を示しています[2]。同じGPU名でも、vCPU、RAM、ローカルストレージ、仮想化、ドライバー、割り当て単位で実効性能は変わります。オンプレ端末のベンチマーク値をクラウドGPUへそのまま流用せず、候補インスタンスで同じ入力を測ります。
ローカルLLMの3年TCOを計算する
ローカルTCOは、取得、稼働、運用、更新・撤去の四つへ分けます。取得にはGPU端末だけでなく、SSD、UPS、ラックや設置、初期構築、セキュリティ審査を含めます。稼働には電力と必要なら空調増分、運用には監視、パッチ、モデル更新、障害対応、評価、バックアップ、アカウント管理を入れます。36か月内に保証が切れるなら延長保証や予備部品も計上します。
計算式は「ローカルTCO=設備取得+初期構築+保証・予備+電力+運用人件費+更新・撤去」です。電力費は「平均実測kW×稼働時間×電力単価」で求めます。NVIDIA L4の公式仕様にある最大TDP 72WはGPU単体の上限であり[1]、端末全体の平均値には使いません。業務時間外に停止するなら、推論稼働、待機、停止を別時間にします。遠隔起動や毎日のモデル読込時間もサービス条件へ影響します。
| 費目 | 仮定 | 計算 |
|---|---|---|
| 設備 | GPU端末、SSD、UPS | 1,200,000円 |
| 初期構築 | 設計、導入、評価、手順化 | 250,000円 |
| 保証・予備 | 3年保証と交換用SSD等 | 180,000円 |
| 電力 | 端末平均0.252kW、24時間、31円/kWh | 0.252×24×365×3×31=205,299円 |
| 運用人件費 | 月10時間、社内原価5,000円/時間 | 10×5,000×36=1,800,000円 |
| 更新・撤去 | 部品、移行、データ消去、廃棄 | 240,000円 |
| 3年合計 | 上記の合算 | 3,875,299円 |
表の金額、0.252kW、31円/kWh、月10時間はすべて仮定値であり、NVIDIAや電力会社の公表価格ではありません。電力のみ上の式で丸め前6,622.56kWh、205,299.36円となり、表では1円未満を四捨五入しました。実測時は負荷試験の平均電力とアイドル電力を分け、契約している電気料金、燃料費調整等の扱いを経理と合わせます。
表の電力費を再計算する手順は次のとおりです。24時間稼働が続くという想定例であり、停止時間がある場合は状態別の時間へ置き換えます。
想定条件: 平均0.252kW、24時間/日、365日/年、3年、31円/kWh消費電力量 = 0.252 × 24 × 365 × 3 = 6,622.56kWh電力費 = 6,622.56 × 31 = 205,299.36円表への記載 = 1円未満を四捨五入して205,299円
人件費1,800,000円は設備より大きいため、「社内担当だから無料」と置くと結論が逆転します。月次パッチ2時間、モデル評価4時間、問い合わせ2時間、バックアップ・権限棚卸し2時間という作業内訳を置き、運用後に実績へ更新します。既存基盤チームが吸収できる場合も、他業務を減らす機会費用と、休日対応の有無を記録します。
クラウドAPIの3年TCOを計算する
API費用は「入力トークン×入力単価+出力トークン×出力単価+キャッシュ・ツール等の費用」で計算します。OpenAI公式API Pricing(2026年7月30日確認)は、モデルごとに入力、キャッシュ済み入力、出力などの単価を掲載しています[3]。価格と対象モデルは変わり得るため、稟議書へ転載した数値だけで36か月を固定せず、確認日、通貨、請求単位、契約割引、税、為替の扱いを記録します。
本稿では計算方法を示すため、入力300円/100万トークン、出力1,200円/100万トークンという仮定単価を使います。月間モデル利用料は、入力30×300+出力6×1,200=16,200円です。監視・ログ30,000円/月、運用5時間×5,000円=25,000円/月、初期接続300,000円と仮定すると、36か月TCOは(16,200+30,000+25,000)×36+300,000=2,863,200円です。
| 費目 | 月額または初期 | 36か月 |
|---|---|---|
| 入力 | 3,000万÷100万×300円=9,000円 | 324,000円 |
| 出力 | 600万÷100万×1,200円=7,200円 | 259,200円 |
| 監視・ログ | 30,000円 | 1,080,000円 |
| 運用人件費 | 25,000円 | 900,000円 |
| 初期接続 | 300,000円 | 300,000円 |
| 合計 | 月71,200円+初期費 | 2,863,200円 |
従量料金だけなら583,200円ですが、監視、運用、接続を足すと約4.9倍です。逆に、既存の監視基盤で追加費用が小さい場合は3万円を減らせます。トークンの再試行やプロンプトを短くできる場合も変わります。費目を一つの「クラウド費」へ丸めず、削減可能な項目と品質維持に必要な項目を区別します。
データ送信が規程上認められない場合、APIが安くても選択肢になりません。データ保持、学習利用、リージョン、委託先、削除、インシデント通知、監査証跡を契約と公式仕様で確認します。匿名化・仮名化に人手が必要ならその工数をAPI側へ加えます。機密を除いた入力だけAPIへ送り、原文はローカルRAGに置く分割構成も比較対象になります。
クラウドGPUの稼働率を見積もる
クラウドGPUは「利用した時間だけ」で計算できるのが強みですが、モデルを常駐させて低遅延にする場合は待機時間も課金対象です。AWSのG6公式資料はL4をGPU当たり24GBのメモリで提供する構成を示し[2]、On-Demand Pricingは長期契約なしの使用量課金を説明しています[4]。メモリ容量は搭載できるモデルの候補を絞る情報であり、実際の時間単価はリージョン、OS、インスタンス型ごとに契約アカウントで確認します。
変数を、GPU時間単価G円、月間起動時間H、ストレージS円、通信N円、周辺サービスM円、運用工数L時間、時間原価R円とすると、月額はG×H+S+N+M+L×Rです。営業時間12時間×営業日22日なら最低264時間ですが、起動・ウォームアップ、夜間バッチ、評価を加えます。24時間常駐なら月730時間前後となり、ローカルの固定費へ近づきます。
| 運用 | 月間GPU時間 | GPU費 | 適する条件 |
|---|---|---|---|
| 予約バッチ | 80時間 | 128,000円 | 夜間処理で起動待ちを許容できる |
| 営業時間常駐 | 264時間 | 422,400円 | 平日日中に対話応答が必要 |
| 24時間常駐 | 730時間 | 1,168,000円 | 深夜・休日も即時応答が必要 |
単価1,600円は仮定であり、G6の実価格ではありません。表はGPU費だけなので、ディスク、スナップショット、ロードバランサー、監視、データ転送、税、運用を加える必要があります。また、停止と起動を自動化しても、モデル取得や読込に10分かかるなら、その時間と利用者への影響を含めます。スポット等の割引を使う場合は、中断時の再実行とチェックポイントの費用を別にします。
短期の実証実験や月末だけの大量処理では、設備購入を避けられるクラウドGPUが有利です。一方、常時稼働で小規模1台を3年使うなら、時間課金がローカル取得費を超える可能性があります。費用だけでなく、冗長化を複数ゾーンで容易に組める価値、社内GPU故障時に代替機を待つリスクも金額または停止時間で比較します。
損益分岐を感度分析する
ローカルTCOを固定費Fと月変動費VL、APIを初期費Iと月固定費VC、100万トークン当たりの混合従量単価P、月間100万トークン数Tとします。36か月の損益分岐は、F+36VL=I+36(VC+P×T)をTについて解きます。入力と出力の単価が違う場合は、Pへ無理に平均化せず、入力Tinと出力Toutを分けます。
上の想定例では、ローカル3,875,299円、APIの初期・監視・運用は2,280,000円、入力・出力従量は月16,200円です。現在量の36か月API TCOは2,863,200円で、ローカルより1,012,099円少なくなります。ただし処理量が同じ構成比で約2.74倍になると、月従量は44,388円、36か月で1,597,968円となり、固定部分を足した3,877,968円でほぼ並びます。これは単価と品質が一定という仮定の分岐です。
| 月間量倍率 | API従量/月 | API 3年TCO | ローカルとの差 |
|---|---|---|---|
| 0.5倍 | 8,100円 | 2,571,600円 | APIが1,303,699円低い |
| 1.0倍 | 16,200円 | 2,863,200円 | APIが1,012,099円低い |
| 2.0倍 | 32,400円 | 3,446,400円 | APIが428,899円低い |
| 2.74倍 | 44,388円 | 3,877,968円 | ローカルが2,669円低い |
| 4.0倍 | 64,800円 | 4,612,800円 | ローカルが737,501円低い |
分岐点は一点ではなく幅で示します。API単価が20%下がる、処理量が計画の半分、ローカル運用が月15時間、GPUを24か月で更新する、というシナリオを組み合わせます。最安シナリオだけでなく、基準・高負荷・障害を並べます。需要予測の誤差が大きい初年度はAPIで実測し、量が安定してからローカルへ移す段階案も合理的です。
平均単価を下げるために小型モデルへ変える場合、同じ品質条件を再確認します。誤答が増えて人の修正が1件2分増え、月20,000件の10%で発生すると、2,000×2分=4,000分、約66.7時間です。時間原価5,000円なら月約333,333円となり、推論費の差を大きく上回ります。この値も想定計算ですが、品質コストをTCOへ入れる必要性を示します。
品質差と乗り換え費用を加える
モデルを変えてもAPI呼び出し先を差し替えるだけとは限りません。プロンプト、ツール呼び出し、JSON Schema、埋め込み次元、モデレーション、ログ形式、評価セット、エラー処理が依存します。ローカルへ移す場合はモデル配布条件、量子化、推論サーバー、認証、脆弱性対応が増えます。クラウド間の移行でも、独自のキャッシュやバッチ、ファイル機能を使うほど工数が大きくなります。
| 作業 | 見積り単位 | 完了条件 |
|---|---|---|
| 互換層 | API、認証、ストリーミング、エラーの改修時間 | 正常・制限・停止の契約テストが通る |
| 品質再評価 | 固定120件の実行、採点、修正時間 | 重大誤り0、採用基準を再達成 |
| RAG再索引 | 文書数、埋め込み量、検証質問数 | 検索再現率と権限試験が合格 |
| 運用変更 | 監視、手順、教育、当番の更新時間 | 障害訓練とロールバックを完了 |
| 並行稼働 | 二重利用月数×双方の月額 | 旧系のログ・データを規程どおり消去 |
想定例:開発120時間、評価60時間、運用整備40時間、時間原価8,000円なら移行人件費は(120+60+40)×8,000=1,760,000円です。並行稼働2か月分と契約解約費があれば追加します。36か月差が100万円しかない候補へ176万円かけて移るなら、費用目的では回収できません。セキュリティや品質改善という別の便益を数値・条件で示します。
乗り換えコストを下げるには、要求・応答の社内形式を定め、特定ベンダーのオブジェクトを業務DBへ直接保存しない、評価セットを共通化する、原文と埋め込み索引を分ける、モデル名を設定で切り替えるといった設計が有効です。ただし最小公倍数の機能だけにすると利用価値を失うため、独自機能を使う箇所と代替手順を台帳化します。
停止と冗長化を費用へ換算する
可用性の条件を費用表から外すと、一台だけのローカル端末が不当に安く見えます。営業時間が月264時間で可用性99.5%なら、許容停止時間は264×(1-0.995)=1.32時間/月です。ハードウェア故障後の代替機到着に翌営業日までかかる設計では、この条件を満たせない可能性があります。予備機、翌日保守、クラウドへの切り替えのどれで復旧するかを決め、その費用を採用案へ加えます。
停止損失は「影響人数×停止時間×時間原価+期限遅延や再処理の追加額」で見積もります。例えば50人が2時間使えず、時間原価4,000円、そのうち20%は代替業務へ移れたと仮定すると、労務影響は50×2×4,000×(1-0.2)=320,000円です。復旧後の再入力が30件、1件10分なら5時間となり、同じ単価で20,000円を足します。合計340,000円は想定シナリオであり、実損ではありません。
| シナリオ | ローカルで必要な対策 | クラウドで必要な対策 | 確認する金額 |
|---|---|---|---|
| GPUまたは端末故障 | 予備機、保守契約、モデルと索引の復元 | 別インスタンス起動、イメージと容量確保 | 対策固定費+復旧までの停止損失 |
| ネットワーク停止 | 社内LAN、認証、拠点間回線の代替 | インターネット、閉域接続、DNSの代替 | 二重回線、切替訓練、業務迂回の費用 |
| モデル更新失敗 | 旧モデル・旧索引の保存と再配備 | 旧モデル提供終了時の代替評価 | 回帰試験、並行稼働、改修工数 |
| 需要の急増 | 追加GPU調達と設置までの待ち | 割当上限申請、追加インスタンス、API制限 | 平常容量とピーク容量の差額 |
| セキュリティ事故 | 端末隔離、証跡、再構築、媒体確認 | 認証鍵失効、ベンダー連携、ログ保全 | 初動、調査、通知、復旧、再発防止 |
期待損失を使う場合は、根拠の薄い発生確率を精密な数字に見せないよう注意します。「年2回、各34万円」と仮定すれば36か月で2×340,000×3=2,040,000円ですが、過去実績がなければこれはストレスシナリオです。基準ケース、年1回、年2回を並べ、どの対策費まで払うと損失を抑えられるかを比較します。重大な情報漏えいを平均的な金額だけで受容せず、発生を許さない統制を別の必須条件にします。
冗長化レベルを同じにして比べる
ローカル一台と、複数ゾーンへ分散したクラウド構成は同じサービスではありません。業務が4時間停止してよいなら、バックアップから予備端末へ復元する設計で足りるかもしれません。数分以内の切替が必要なら、ローカルでも二台常時稼働、負荷分散、認証とベクトルDBの冗長化が必要です。クラウドも自動的に無停止になるわけではなく、複数系統、ヘルスチェック、データ複製、復旧訓練を購入・構築します。
目標復旧時間RTOと許容データ損失RPOを業務別に置きます。規程QAがRTO4時間・RPO24時間、顧客向け対話がRTO15分・RPO0というように違うなら、一つの共通基盤で最も厳しい要件を全機能へ課すより、サービスを分ける方が安い場合があります。構成ごとの復旧試験に要した担当時間も運用費へ入れます。
| 比較条件 | ローカル | クラウド | 証拠 |
|---|---|---|---|
| RTO 4時間 | 予備端末、四半期復元試験 | 停止イメージから別GPUを起動 | 直近訓練の実測復旧時間 |
| RPO 24時間 | 日次バックアップと別媒体 | 日次スナップショットと保持費 | 復元点のハッシュと時刻 |
| 月99.5% | 監視、当番、保守受付時間 | SLAだけでなく自社経路の監視 | 利用者から見た停止分数 |
冗長化を加えた後に再び損益分岐を計算します。ローカル予備機に80万円、年4回の復旧訓練に各4時間、時間原価5,000円を置くと、3年間の追加は800,000+4×4×5,000×3=1,040,000円です。クラウド側にも待機ディスク、スナップショット、複数系統の月額を加えます。片側だけを本番品質にして比べないことが、TCO比較で最も重要です。
要件別に構成を選ぶ
月間量が少なく変動が大きい、短期間で始めたい、最新の高性能モデルを使いたい場合はAPIが候補です。定時バッチや一時的な大量処理、GPU構成を柔軟に変えたい場合はクラウドGPUが合います。外部送信できないデータを扱い、量が安定し、基盤運用者がいて、許容品質をローカルモデルで達成できるなら社内設置を検討できます。
| 優先条件 | 第一候補 | 確認事項 |
|---|---|---|
| 初期費を抑え短期検証 | 生成AI API | 従量上限、データ条件、モデル変更通知 |
| 月末・夜間の集中処理 | クラウドGPU | 起動時間、中断、停止忘れ、ストレージ |
| 閉域・安定した継続量 | ローカルLLM | 担当者、予備機、更新、品質上限 |
| 機密原文と高度生成を両立 | ハイブリッド | 境界で送るデータと障害時の動作 |
本稿の想定値では、現在量ならAPIが3年で約101万円低く、2.74倍付近でローカルと並びます。そのため、初年度はAPIで実測し、月間量が分岐を6か月連続で超え、ローカル候補が品質・可用性を満たした時点で再稟議する案が考えられます。機密文書だけローカルRAG、一般文案をAPIにする構成なら、量と責任範囲を分けてTCOを足します。安くても見送る条件と向かないケース
法令・契約・社内規程で外部送信が禁止される、必要品質をローカル候補が満たさない、24時間対応できる運用者がいない、撤退時にデータを取り出せない場合は、最安案を採用しません。情報セキュリティ、法務、財務、業務責任者が非価格条件を先に判定します。
稟議には、採用案だけでなく棄却案、単価確認日、仮定値、実測値、分岐点、再評価日を添えます。月次は要求量と単価、四半期は品質・運用時間、年次は設備更新と契約条件を見直します。価格が変わっても式へ新しい値を入れれば、印象ではなく同じ基準で再判断できます。
比較を始める担当者は、まず直近14日分の利用ログから要求数、入力・出力トークン、同時実行、p95完了時間を集計してください。次に、運用担当へ月間保守時間と障害対応時間を確認し、ローカル、クラウドGPU、APIの三列へ同じ36か月の式を入れます。公表仕様、実見積、仮定値を色や注記で区別した時点で、候補ごとの感度分析へ進めます。
参考文献・出典
- NVIDIA公式製品仕様「NVIDIA L4 Tensor Core GPU」(ローカルLLMの設備・電力TCOに使う24GB GPUメモリと最大TDP 72W、2026年7月30日確認)
- Amazon Web Services公式ドキュメント「Amazon EC2 G6 Instances」(クラウドGPUの容量条件となるNVIDIA L4、GPU当たり24GBメモリ、2026年7月30日確認)
- OpenAI公式APIドキュメント「API Pricing」(クラウドAI APIの入力、キャッシュ済み入力、出力などのモデル別料金、2026年7月30日確認)
- Amazon Web Services公式料金資料「Amazon EC2 On-Demand Pricing」(クラウドGPUの稼働時間費用を見積もるオンデマンド課金の説明、2026年7月30日確認)