Amazon SageMaker HyperPod がモデルキャッシュのサポートを開始し、推論のオートスケーリングを高速化してコールドスタートを削減

投稿日: 2026年9月11日

Amazon SageMaker HyperPod が、推論を最適化するモデルキャッシュのサポートを開始しました。モデルキャッシュでは、モデルの重みとコンテナイメージがクラスターノードに事前にロードされるため、ポッドの起動時間を数分から数秒に短縮できます。

チャットアシスタント、エージェンティックパイプライン、RAG、ドキュメント分析などのワークロードで LLM 推論を大規模に実行する場合、コールドスタートが大きなボトルネックになります。デプロイとスケールアウトのイベントでは、コンテナイメージとモデルの重みのダウンロードに大半の時間が費やされます。モデルのサイズが大きくなるほど、この問題は悪化し、大規模なモデルではトラフィックを処理できるようになるまでに数十分かかります。

モデルキャッシュでは、独立した 2 つの機能を使用してこの問題を解決します。重みキャッシュでは、モデルの重みをローカル NVMe に保存します。そのため、ポッドはネットワーク経由で S3 または FSx から取得する代わりに、高速なローカルストレージからモデルの重みを読み取ります。イメージキャッシュではコンテナイメージを事前に取得するため、ポッドでは ECR からダウンロードする必要がなくなります。ウォームキャッシュがないノードにポッドが配置された場合は、元のソースからの取得に自動で切り替わるため、ポッドが停止したままになったり、失敗したりするリスクはありません。

57 GB~145 GB のモデルを対象としたベンチマークでは、スケールアウトが約 60% 高速化し、イメージキャッシュによって 2 分を超えるイメージ取得時間が短縮されました (97% の削減)。モデルのサイズが大きくなるほどメリットも大きくなり、元のソースパスを使用する場合と同等の信頼性も維持できます。

お客様は、InferenceEndpointConfig または JumpStartModel リソースに modelCacheConfig セクションを追加することで、HyperPod Inference Operator を介してモデルキャッシュを有効にできます。ライフサイクル全体はオペレーターによって処理されるため、手動でのセットアップやクリーンアップは必要ありません。

モデルキャッシュは、SageMaker HyperPod を利用できるすべてのリージョンで一般提供されています。使用を開始するには、SageMaker HyperPod に関するドキュメントを参照してください。