AI研究科学者向けCUDAによるカスタムカーネル開発入門
AI研究科学者がカスタムAIアルゴリズムをGPUで効率的に実装するためのCUDAプログラミングの基本概念、カーネル開発、メモリ最適化、非同期実行、およびパフォーマンスプロファイリングの基礎を習得します。
...
Share
CUDAプログラミングの基礎とカーネル開発
Unit 1: CUDAの世界へようこそ
GPUって何?
CUDAの第一歩
Unit 2: CUDAプログラミングモデルの核心
ホストとデバイス
カーネルの魔法
スレッド、ブロック、グリッド
スレッドIDを使いこなす
Unit 3: 初めてのCUDAカーネル
C++からCUDAへ
ベクトル加算に挑戦
行列の要素ごとの演算
GPUメモリ最適化と非同期実行、パフォーマンス分析の初歩
Unit 1: GPUメモリの深層
メモリ階層の基礎
グローバルメモリの活用
共有メモリで高速化
定数メモリの秘密
Unit 2: 非同期処理とパフォーマンス
CUDAストリーム入門
データ転送と実行の並行
Unit 3: パフォーマンス分析の第一歩
Nsight Systemsで分析
ボトルネックを見つけよう