智能計算系統——從軟件框架到硬件實現(微課視頻版)
胡群超 王攀 徐瑞
相關主題
商品描述
目錄大綱
目錄
第1章深度學習軟硬件概述
視頻講解: 21分鐘,8集
1.1深度學習基礎
1.1.1深度學習的定義與發展歷程
1.1.2神經網絡基本原理
1.1.3深度學習主要應用領域
1.2深度學習系統工作流程
1.3深度學習軟件棧
1.3.1框架前端
1.3.2計算圖中間表示
1.3.3框架後端運行時
1.3.4深度學習編譯器
1.3.5硬件代碼生成器
1.3.6框架調試工具鏈
1.3.7數學庫
1.3.8硬件抽象運行時
1.3.9硬件驅動與固件
1.3.10硬件調試工具鏈
1.3.11硬件概述
1.3.12總結
1.4深度學習硬件平臺
1.4.1處理單元
1.4.2異構架構
1.4.3總結
1.5深度學習系統面臨的挑戰
1.5.1計算效率與能耗
1.5.2內存帶寬與數據移動
1.5.3模型規模與復雜度增長
1.5.4部署環境的多樣性
第2章軟件框架
視頻講解: 23分鐘,8集
2.1深度學習軟件框架
2.1.1PyTorch總體概述
2.1.2PyTorch核心模塊
2.1.3TensorFlow總體概述
2.1.4兩框架比較
2.2中間表示
2.2.1計算圖概述
2.2.2TorchDynamo
2.2.3TorchScript
2.2.4ONNX
2.2.5IR級別的優化技術
2.2.6硬件感知的IR設計
2.3未來發展趨勢
第3章深度學習編譯器
視頻講解: 19分鐘,6集
3.1深度學習編譯器概述
3.1.1系統結構
3.1.2工作流程
3.1.3對外接口
3.1.4典型深度學習編譯器
3.1.5應用場景
3.1.6總結
3.2TVM概述
3.2.1系統結構
3.2.2工作流程
3.2.3應用場景
3.2.4總結
3.3TVM關鍵技術
3.3.1TVM關鍵模塊
3.3.2TVMScript
3.3.3中間表示的轉換
3.3.4對外擴展接口
3.3.5TVM與LLVM的結合
3.3.6TVM與CUDA的結合
3.3.7TVM與第三方算子庫結合
3.3.8添加新GPU的支持
3.4深度學習編譯優化技術
3.4.1算子優化
3.4.2圖結構優化
3.4.3硬件感知優化
3.4.4其他模型優化方法
3.5硬件代碼生成器概述
3.6LLVM概述
3.6.1框架
3.6.2流程
3.6.3應用場景
3.6.4優缺點
3.6.5總結
3.7LLVM前中端關鍵技術
3.7.1前端處理過程
3.7.2IRBuilder
3.7.3抽象語法樹
3.7.4LLVM IR
3.7.5中端處理過程
3.8LLVM後端代碼生成器
3.8.1代碼生成器架構
3.8.2代碼生成器工作流程
3.8.3生成器實現途徑
3.8.4LLVM後端新硬件的擴展
3.9編譯器與生成器的協同工作
3.10TPU、NPU與GPU比較
3.11未來發展趨勢
第4章深度學習算法庫
視頻講解: 9分鐘,3集
4.1算法庫概述
4.1.1算法庫主要功能
4.1.2常見深度學習算法庫
4.1.3並行編程
4.1.4庫函數的基本結構
4.1.5庫函數內部並行化
4.1.6算法庫與學習框架的融合
4.1.7算法庫、運行時、驅動之間的融合
4.1.8總結
4.2算法庫的優化技術
4.3算法庫未來發展趨勢
第5章底層軟件系統
視頻講解: 22分鐘,7集
5.1運行時系統概述
5.2圖計算運行時
5.3硬件抽象運行時
5.4ONNX Runtime
5.5硬件驅動系統
5.6顯卡固件系統
5.7底層軟件系統關鍵技術
5.7.1內存管理技術
5.7.2同步機制
5.7.3事件和流管理
5.7.4核函數裝載啟動
5.7.5異構可執行文件
5.7.6異構執行模型
5.8GPU、NPU、TPU對比分析
5.9未來發展趨勢
第6章底層硬件架構
視頻講解: 28分鐘,9集
6.1硬件需求
6.2硬件系統
6.2.1概述
6.2.2硬件的基本結構
6.2.3硬件組織方式
6.2.4工作流程
6.2.5優化技巧
6.2.6總結
6.3硬件關鍵技術
6.3.1內部高速互連
6.3.2外部高速互連
6.3.3高帶寬存儲
6.4GPGPU架構分析
6.4.1概述
6.4.2總體架構
6.4.3工作流程
6.4.4關鍵模塊
6.4.5GPGPU常用指令
6.4.6典型應用
6.4.7SIMD與SIMT的比較
6.4.8總結
6.5NPU架構分析
6.5.1概述
6.5.2總體架構及工作流程
6.5.3NPU常用指令
6.5.4NPU與GPU程序執行模型區別
6.5.5NPU優化深度學習運算
6.5.6NPU與GPU總體比較
6.5.7NPU與TPU總體比較
6.5.8應用場景
6.5.9優勢與劣勢
6.5.10典型產品
6.5.11發展趨勢
6.5.12總結
6.6性能與能效評估方法
6.6.1TOPS/W指標解析
6.6.2能耗與計算效率的權衡
6.7新興計算架構探索
6.7.1存算一體(PIM)技術
6.7.2光子計算與量子計算對深度學習的影響
6.8未來展望
第7章調試和性能分析
視頻講解: 4分鐘,1集
7.1深度學習系統調試概述
7.1.1調試的重要性和挑戰
7.1.2調試工具和方法概述
7.2模型級調試
7.2.1模型可視化
7.2.2模型單元測試
7.2.3數據集與標簽調試
7.3後端系統調試
7.3.1運行時事件捕獲
7.3.2運行時異常處理
7.3.3運行時性能監控
7.3.4底層系統調試
7.4系統性能分析
7.4.1性能瓶頸定位
7.4.2性能優化方法
7.5可解釋性與可靠性
7.5.1模型可解釋性
7.5.2系統可靠性
7.6未來發展趨勢
參考文獻







