01
GPUクラスタ設計・構築
NVIDIA H100 / H200 / B200 世代が対象です。ノード構成、InfiniBand NDR / HDR ファブリック、ラック配置、電力と冷却まで含めて設計します。8 GPUの検証環境から、128 GPU規模の学習クラスタまで。これを超える規模は、提携先との共同受託で対応します。
AI INFRASTRUCTURE
難しいのは、GPUを買うことではありません。止めずに回し続けることです。ノードは壊れる。インターコネクトは詰まる。学習ジョブは深夜に落ちる。私たちが引き受けているのは、その後始末まで含んだ設計です。
01
NVIDIA H100 / H200 / B200 世代が対象です。ノード構成、InfiniBand NDR / HDR ファブリック、ラック配置、電力と冷却まで含めて設計します。8 GPUの検証環境から、128 GPU規模の学習クラスタまで。これを超える規模は、提携先との共同受託で対応します。
02
提携データセンターおよびGPUクラウド事業者の設備を用いて、専有ベアメタル、または論理分離したテナントとして提供します。時間課金でも月額専有でも構いません。国内に閉じた構成も選べます。
03
ラックあたり30〜80kW。この密度に耐えられる国内データセンターを選び、電力契約、空調方式(空冷/液冷)、搬入経路まで調整します。
04
Slurmか、Kubernetes + Kueueか。ジョブ管理の方式は、ワークロードの性質から決めます。分散ストレージはLustre / WEKA / Cephのいずれかを、読み書き特性に合わせて構成します。
05
ノード温度、ECCエラー、NVLink / IBのリンク断、ジョブ失敗率。常時監視し、故障ノードは自動で隔離して再スケジュールします。一次対応は当社が持ちます。
06
基本負荷はお客様保有のクラスタ、ピークはパブリッククラウドへ。この形にすれば、ピークのためだけにGPUを買い増す判断を避けられます。
よくいただくご相談
対応スペック
| 対応GPU | NVIDIA H100 / H200 / B200、L40S、A100(既存資産の継続利用を含む) |
|---|---|
| クラスタ規模 | 8 GPU 〜 128 GPU(当社単独での受託範囲)。これを超える規模は、データセンター事業者・SIerとの共同受託で対応します |
| インターコネクト | InfiniBand NDR 400G / HDR 200G、RoCEv2 |
| ストレージ | Lustre / WEKA / Ceph。NVMeオールフラッシュ層と容量層の二階層構成 |
| スケジューラ | Slurm、Kubernetes + Kueue、Ray |
| 設置 | 提携先の国内データセンター(東京圏・関西圏)、ラックあたり30〜80kW対応 |
| 稼働率目標 | 月次99.5%(計画停止を除く) |
「GPUは何枚必要か」「持つべきか、借りるべきか」。いちばん多いのは、この段階のご相談です。要件が固まっていなくて構いません。