機密情報やコード資産を安全に運用するため、自社専有のオンプレミス環境にローカルLLM(大規模言語モデル)を導入するニーズが高まっている。トークン課金の心配がなく無制限に利用できる一方、限られたリソースでは、複数リクエスト処理時に深刻な応答遅延が発生する点が導入の障壁であった。
本資料は、セキュアAIアプライアンスに採用されている大規模MoEモデルGLMの推論最適化検証レポートだ。この取り組みでは、モデルの特性(MLA/DSA/疎なMoE)を踏まえたDP Attentionの導入によってKVキャッシュ容量を拡大し、KVキャッシュ考慮のルーティングやCPUキャッシュオフロードによってPrefillの再計算を回避することに成功した。
コーディングエージェントの実ワークロードに基づくベンチマーク評価では、応答開始までの待ち時間(P90 TTFT)を59秒から3.8秒へ約15分の1に短縮し、同時接続数の最大化を実現。本資料では、B200環境との比較検証からハードウェア選定のコツまで紹介しているので、安全かつ高速なAI環境を構築するための手引きとして役立ててほしい。