異種コンピューティング管理 & 国内AIコンピューティングプラットフォーム

CPU・GPU・NPUの異種コンピューティングリソースを統一的にスケジューリングし、数千カードから1万カード規模の国内AIコンピューティングクラスタを構築

機能概要

CPU、GPU、NPUなどの異種コンピューティングリソースを統一的にスケジューリングし、数千カードから1万カード規模の国内AIコンピューティングクラスタを構築して、大規模モデルの学習・推論とビジネス規模のアプリケーションをサポートします。

お客様の課題

  • コンピューティングリソース(CPU/GPU/NPU)が分散しており、利用率が低く、統一的なスケジューリングができません。
  • 国内コンピューティング(Huawei Ascend、Pingtougeなど)への適合が難しく、モデル推論の性能も低い状態です。
  • 大規模モデルの学習コストが高く、数千カードから1万カード規模への拡張計画も不足しています。
  • データセンターのエネルギー消費が高く、PUE最適化が不十分で、非リアルタイムコンピューティングとリアルタイムコンピューティングの連携もできていません。

ソリューションの特長

  • フルスタック国産化の数千カードクラスタ:Huawei Ascendをベースに構築し、ハードウェア調達からモデルチューニングまでエンドツーエンドで共同最適化を実施します。
  • 異種コンピューティングの統一スケジューリング:クラウドプラットフォームが上海、合肥、ホリンゴルの3都市5センターのコンピューティングパワーを一元管理し、"リアルタイム+非リアルタイム"の連携を実現します。
  • モデルの軽量化機能:大・小・マルチモーダルモデル間の連携をサポートし、モデル蒸留により導入コストを削減します。
  • 1万カード規模への発展計画:1万カード規模に拡張し、複雑なAIシナリオをサポートします。
  • グリーンデータセンター:"東数西算(East Data West Computing)"、PUE最適化、AIOpsによるインテリジェント故障予測、エネルギー管理を実現します。

アーキテクチャ図

アーキテクチャ図