|
| 商品編號: | DUE4145 |
|
| 商品名稱: | Udemy線上課程 (Ken Cen出品)Generative AI第26部 Mistral 語言模型的架構祕密 講師:瞭解更多 影音教學 中文發音 |
|
| 商品分類: | Udemy線上課程綜合教學 |
|
| 語系版本: | 中文發音 繁體中文版 | |
| 商品類型: | Ken Cen出品 | |
| 運行平台: | 官方原版畫質MP4檔,沒有任何平台限制,終身使用 | |
| 更新日期: | 2026-08-20 |
|
| 光碟片數: | 1片DVD光碟 |
|
| 銷售價格: | $200元 |
|
| 熱門標籤: | Udemy線上課程
語言模型的架構祕密
Mistral
| |
|
|
Udemy線上課程 (Ken Cen出品)Generative AI第26部 Mistral 語言模型的架構祕密 講師:瞭解更多 影音教學 中文發音 繁體中文版(DVD版)
本課程延續Generative AI 第 18~25 部,繼續講解大語言模型架構技術的原理,圍繞Mistral 大語言模型與原始 Transformer 之間的架構差異展開。
其中包括如下技術:
Sliding Window Attention - 滑動窗口注意力:
限制注意力計算在固定大小窗口內,減少計算量
Rolling Buffer Cache - 滾動緩衝區緩存:
一種用於推理時保存中間計算結果的緩存技術
Sparse Mixture of Experts (MoE) - 稀疏混合專家模型:
利用多個專家子網絡並行處理,提升模型容量與效率
KV 緩存 - Key-Value Cache:
儲存注意力機制中Key和Value的緩存,加速推理
Feedforward Networks (Experts) - 前饋網絡(專家):
MoE中多個獨立的前饋子網絡,負責不同輸入的處理
Model Sharding - 模型分片:
將模型參數分散到多個設備上以減少單設備負擔
01 - 課程軟體準備
001 加入Udemy 全球最大的中文 AI 課程.mp4
002 課程工具準備.mp4
003 如何使用uv 作為包管理器和項目管理工具.mp4
02 - 什麼是 Sliding Window Attention,它與感受野 Receptive Field 有什麼關係?
001 什麼是 Mistral & 它的核心技術.mp4
002 什麼是 Sliding Window Attention & 感受野 & Causal Mask.mp4
03 - 什麼是Rolling Buffer Cache 技術
001 什麼是 KV Cache KV 快取 & Rolling Buffer Cache滾動快取緩衝區 & Prefilling 預填& Chunking 分塊處理.mp4
002 如何使用 Pytroch 實現 Sliding window做 Prefill 預填充.mp4
003 如何用Pytorch 實現 Unrotate 反旋轉.mp4
04 - 什麼是Mistral 語言模型的Sparse Mixture of Experts (MoE) 技術
001 什麼是稀疏混合專家模型sparse MoE 技術.mp4
05 - 什麼是Mistral 語言模型的Model Sharding技術
001 什麼是 Model Sharding 模型切片 & Pipeline Parallelism 管線平行化 & 區塊對角線因果掩碼.mp4
|
|