Udemy線上課程 (Ken Cen 出品) Generative AI 第 36 部:AI 速度之王 FlashAttention 演算法 講師:瞭解更多 影音教學 中文發音 繁體中文版(DVD版)
這門課程是專為已經掌握 Triton 基礎,渴望在 AI 高效能計算(HPC)領域深耕的工程師設計。
我們將帶您超越函式庫的呼叫,親手編寫並部署當今最先進、最快的 Transformer 注意力機制——FlashAttention
學完本課程,您將從 AI 模型的使用者,晉升為 性能極限的創造者
本課程將解鎖的核心技術:
1. Online Softmax 與 Flash Attention 核心概念
掌握 SOTA 演算法基礎: 理解傳統注意力機制(softmax)的記憶體瓶頸,並掌握 Flash Attention 如何從理論上解決這個問題,為您的模型帶來 數倍的訓練和推理速度
2. 使用 Triton 處理因果掩碼
加速生成式 AI 的基石: 學習在 Triton 底層高效地實現 因果掩碼(Causal Masking)。
這直接決定了 GPT 這類自迴歸模型在生成文本時的計算效率和速度
3. 分塊 Softmax (mi? 與 α 校正)
攻克數值穩定性難題: 這是 Flash Attention 的靈魂所在。
您將學會如何應用 Log-Sum-Exp 技巧,在進行分塊計算時,維持 16 位浮點數(FP16)的極高速度,同時避免數值溢出或精度損失,這是編寫生產級 AI 內核的必備技能
4. 「一個鎖定 + 一個遍歷」的 Triton 策略
極致的 GPU 記憶體優化: 掌握 Triton 中頂級的性能模式。
這種高階的並發策略能最大化 GPU 暫存器和 SRAM 的利用率,將記憶體頻寬利用率推向極限,讓您的程式碼比大多數人編寫的 CUDA 程式碼更快
5. 自動微分系統集成
成為框架級別的擴展者: 學習如何利用 PyTorch 的 torch.autograd.Function,將您自定義的 Triton 前向與反向內核無縫集成到自動微分系統中。
這讓您能夠為任何 PyTorch 模型貢獻或定製高效能操作
01 - 為編譯環境做準備
001 加入Udemy 全球最大的中文 AI 課程.mp4
002 揭秘加速Transformer 中注意力矩陣運算的方法.mp4
003 課程工具準備.mp4
004 如何使用uv 作為包管理器和項目管理工具.mp4
02 - Online Softmax 與 Flash Attention 是什麼
001 什麼是 Online Softmax & Flash Attention.mp4
002 如何使用 Triton 處理因果掩碼和 Flash Attention.mp4
03 - 如何用 Triton 在前向傳播中實現分塊 softmax 更新m_i 和校正因子 alpha
001 如何用 Triton 在前向傳播中實現分塊 softmax 更新m_i 和校正因子 alpha.mp4
04 - 如何在 Triton 中實現「一個鎖定+一個遍歷」的策略
001 如何在 Triton 中實現「一個鎖定+一個遍歷」的策略.mp4
05 - 如何使用自動微分系統傳遞前向傳播和反向傳播的張量和數值
001 如何使用自動微分系統傳遞前向傳播和反向傳播的張量和數值.mp4
002 如何驗證 Pytorch 與 Triton 運行結果是否一致.mp4
|
|