VeloC: Towards High Performance Adaptive Asynchronous Checkpointing at Large Scale

IPDPS 2019(2019) · 論文 · nicolae2019veloc

📅 この論文を見た日

初回 2026-09-22 / 最終 2026-09-22 / 計 1 回更新

AI解説

実装: VELOC、https://github.com/ECP-VeloC/VELOC 情報源: 本文は未取得(IEEE Xplore がペイウォールで、他の無料ミラーも見つからなかった)。ここに書くのは Illinois Experts(著者所属機関のリポジトリ)に掲載されたアブストラクトの範囲に限る。同じ開発チームによる後継論文(arXiv:2103.02131、2021、”VELOC: VEry Low Overhead Checkpointing in the Age of Exascale”)は全文を確認できるが、対象論文そのものではないため、この # AI解説 には反映しない(別ノートの候補として扱う)。

一言で(アブストラクトの範囲)

多くの HPC アプリケーションは並列ファイルシステムのような外部ストレージへ大域的にチェックポイントするのが一般的な I/O パターンだが、外部ストレージの I/O スループットが限られているため、これがしばしば I/O ボトルネックを引き起こす。VeloC は、性能モデリングと軽量な監視を組み合わせた非同期チェックポイント手法を提案し、バックグラウンドでのフラッシュに合わせてローカルストレージデバイスを動的に選ぶことで、チェックポイントのオーバーヘッドを最小化する。プレ・エクサスケールシステムでの評価で大きな性能向上を示したとされる。

背景・問題(アブストラクトの範囲)

外部ストレージへの大域的なチェックポイントは一般的な I/O パターンだが、外部ストレージの I/O スループットには限りがあるため、大域チェックポイントはしばしば I/O ボトルネックを引き起こす、というのがアブストラクトで述べられる問題設定である。

提案手法(アブストラクトの範囲)

性能モデリングと軽量な監視(monitoring)を組み合わせた非同期チェックポイントの手法を提案する。バックグラウンドでのフラッシュに適応させる形でローカルストレージデバイスを動的に選択し、チェックポイントのオーバーヘッドを最小化する、とアブストラクトに述べられている。具体的なアーキテクチャ(ローカル保存とバックグラウンド掃き出しの実装、SCR や FTI とのインタフェース関係)や性能モデルの詳細は、本文を確認できていないため書かない。

実験・結果(アブストラクトの範囲)

プレ・エクサスケールシステムでの評価により、大きな性能向上を示したとアブストラクトに述べられている。具体的な数値(速度向上率やスループットなど)は本文を確認できていないため書かない。

関連研究との関係(メモ)

Q&A

(自分がAIに実際に質問したことだけをQ/A形式で残す。まだなし。)

自分のコメント

(ここは自分で都度書く欄。本文PDFが入手できたら、このノートを本文精読ベースに書き直す必要がある。)