|
| 商品編號: | DUE4147 |
|
| 商品名稱: | Udemy線上課程 (Ken Cen出品)Generative AI第28部 LLM 對齊革命 - PPO X DPO 策略優化 講師:瞭解更多 影音教學 中文發音 |
|
| 商品分類: | Udemy線上課程綜合教學 |
|
| 語系版本: | 中文發音 繁體中文版 | |
| 商品類型: | Ken Cen出品 | |
| 運行平台: | 官方原版畫質MP4檔,沒有任何平台限制,終身使用 | |
| 更新日期: | 2026-08-20 |
|
| 光碟片數: | 1片DVD光碟 |
|
| 銷售價格: | $200元 |
|
| 熱門標籤: | Udemy線上課程
對齊革命
策略優化
| |
|
|
Udemy線上課程 (Ken Cen出品)Generative AI第28部 LLM 對齊革命 - PPO X DPO 策略優化 講師:瞭解更多 影音教學 中文發音 繁體中文版(DVD版)
(Ken Cen出品)Generative AI第28部 LLM 對齊革命 - PPO X DPO 策略優化
課程會在(Ken Cen出品)Generative AI第27部的基礎上,深入發掘 PPO 和 DPO 對修正 AI 行為背後的原理的 Pytorch 實際操作。
為什麼要學習 PPO 和 DPO?
隨著大模型快速發展,我們愈來愈關注一個核心問題:
模型的回答是否符合人類偏好?是否「對齊」人類的價值與需求?
本課程介紹的 PPO(Proximal Policy Optimization) 和 DPO(Direct Preference Optimization) 是目前最主流的兩種對齊技術。
掌握這些技術,你將能:
訓練出 對使用者更友善、更精確的 LLM
學會如何實作如 ChatGPT背後的策略調整機制
跟上大型 AI 公司對「對齊問題(Alignment)」的技術趨勢
課程內容重點介紹
PPO 對齊技術精解
PPO 損失函數組成與剪裁(Clipping)避免模型劇烈更新,提升穩定性。
Advantage Function & Value Function評估「採取行動比預期好多少」,是強化學習的核心。
Entropy(熵)獎勵:鼓勵探索、避免陷入局部最優熵越高 → 模型更願意嘗試新策略。
Frozen Model & KL懲罰:防止「作弊」學壞固定參考模型,並限制與其差異,防止模型偏離人類偏好。
DPO 對齊革命性新方法
從獎勵模型到 Bradley-Terry 偏好模型從 pairwise 比較中學習人類偏好。
DPO 損失函數推導與數學解析解理論 + 工程實作,讓你掌握真正原理。
KL 散度約束與 Lagrange 乘子技術精準控制策略偏移與對齊速度。
PyTorch實戰:從理論到實作
你將學會如何用 PyTorch 完整實現:
PPO 訓練流程:包括策略梯度、值函數損失、熵項與總損失計算
DPO 訓練流程:用偏好資料直接優化策略,無需建立獎勵模型
SFT(Supervised Fine-Tuning)監督微調流程
計算 Log Probability、KL 散度、Entropy 等關鍵指標
01 - 課程準備
001 加入Udemy 全球最大的中文 AI 課程.mp4
002 課程工具準備.mp4
003 如何使用uv 作為包管理器和項目管理工具.mp4
02 - PPO 的原理 & 如何用 Pytorch 實現 PPO
001 什麼是 PPO Policy Gradient & PPO Clipped Objective & Value Function Loss.mp4
002 如何使用 Pytorch 訓練 PPO 並計算對數機率 & KL 散度 & 策略熵.mp4
03 - DPO 的原理&如何使用 Pytorch 實現 DPO
001 什麼是 DPO & 如何解決約束優化問題.mp4
002 如何使用 Pytorch實現 SFT 監督微調.mp4
003 如何使用 Pytorch實現 DPO 直接偏好優化 Direct Preference Optimization.mp4
|
|