NVIDIA Resiliency Extension (NVRx) を Amazon EKS 上の PyTorch FSDP トレーニングに統合して、チェックポイント I/O をトレーニングとオーバーラップさせ、GPU 障害から数秒で回復します。この投稿では、非同期チェックポイント、プロセス内休止について説明します。
コンピューティングの供給、エネルギー、データセンターの容量によって、AI をいかに安価に実行できるかが決まります。インフラストラクチャの変化は数週間後に推論コストに現れます。
概要は情報提供のみを目的としてまとめられています。全文についてはソース リンクを参照してください。デモのエントリは一例です。