大模型數據:原理、技術與實戰
何聰輝 吳酈軍 張文濤
- 出版商: 電子工業
- 出版日期: 2026-04-01
- 售價: $474
- 貴賓價: 9.5 折 $450
- 語言: 簡體中文
- 頁數: 192
- ISBN: 7121523744
- ISBN-13: 9787121523748
-
相關分類:
Data-visualization
立即出貨
買這商品的人也買了...
-
$351白話統計 -
$300人工智能算法 捲1 基礎算法 -
特徵工程不再難:資料科學新手也能輕鬆搞定! (Feature Engineering Made Easy: Identify unique features from your dataset in order to build powerful machine learning systems)$520$405 -
$351人工智能算法 捲2 受大自然啟發的算法 -
代碼隨想錄 — 跟著 Carl 學算法$828$786 -
$606利用 Python 實現概率、統計及機器學習方法(原書第2版) -
$861精通機器學習算法 -
$356強化學習演算法入門 -
$469AI 量化交易:高效構建交易策略的新路徑 -
$550代碼隨想錄2:圖論 -
$882概率機器學習 (基礎篇) -
$612大數據相關關系和因果關系 -
$948基於大數據和人工智能的金融研究 -
$402Gemini 深度使用手冊 -
$469具身智能靈巧手操作 -
AI 高質量論文寫作法:開題、文獻、寫作、自查、答辯一本通$359$341 -
大數據財務分析 — 基於新道 DBE Cloud$336$319 -
$358財務大數據分析(微課版) -
10 倍速!AI Skill 全攻略:建立 Skill 驅動 AI 系統,打造從學術研究到專案開發的自動化工作流$1,000$780 -
$959人工智能數學基礎 -
Gemini 使用指南$474$450 -
一本搞定 Google AI:Gemini、NotebookLM、Workspace AI、Nano Banana 到 Gemini Omni,學會清晰化、結構化、規格化的 AI 工作法$399$315 -
Gemini Notebook 知識管理術 - 打造你的 AI 第二大腦$620$489 -
Gemini Notebook 任務神助手:200+ 實戰指令串聯 Gemini Notebook 與 AI Agent,全面解鎖學習、職場、生活與創意應用$650$507 -
AI 提問 X 學習 X 應用:ChatGPT、NotebookLM、Gemini、GitHub Copilot,從零到 AI Agent 實戰$390$308
簡體書新到貨|2書75折 (8/25--8/31) 詳見活動內容 »
-
85折
$550量子計算與人工智能 -
VIP 95折
圖解Skill+OpenClaw:零代碼打造你的AI智能助手$414$393 -
85折
$254OpenClaw快速上手極簡部署與實戰 -
85折
$254LangChain與大語言模型應用開發實踐 -
85折
$1,014系統安全工程導論 -
85折
$351機器人學基礎 第4版 -
79折
$469StatQuest 圖解神經網絡與深度學習 (全彩) -
85折
$254國產龍蝦實操手冊:12款OpenClaw國產AI工具零基礎入門+全場景應用(視頻教學版) -
85折
$606openvela輕量系統開發實戰 -
85折
$504智能網聯汽車:AUTOSAR Adaptive平臺技術體系與應用指南 -
VIP 95折
智能體的超級大腦:大模型工作原理揭秘$359$341 -
VIP 95折
30天輕松學會SQL$599$569 -
85折
$254大模型賦能的智能體系統原理與實踐 -
VIP 95折
先進智能感知技術與應用$1,008$957 -
VIP 95折
視覺智能 — 技術前沿與應用探索$894$849 -
VIP 95折
分布式數據庫系統:原理解析與架構設計$474$450 -
85折
$453理解深度學習 -
VIP 95折
AI 優先:面向未來的企業和品牌行動指南$414$393 -
VIP 95折
玩賺 AI 短視頻 : DeepSeek + 即夢 + 剪映 打造爆款視頻$474$450 -
VIP 95折
飛書雲端安全養蝦 極簡OpenClaw實操手冊$479$455 -
VIP 95折
雲網融合的新型網絡架構$594$564 -
VIP 95折
Seedance創富手冊:零基礎做電商帶貨和自媒體$474$450 -
VIP 95折
Python辦公自動化:基於銀河麒麟(Kylin)系統的實現方法$414$393 -
VIP 95折
自然語言處理實踐:語義理解與信息抽取$534$507 -
85折
$300大模型應用
商品描述
本書系統構建了大模型 數據科學的理論框架與工程 實踐體系,在編寫時特別註 重技術深度與落地應用的結 合。本書主體詳細介紹了大 模型數據的全生命周期管理 ,涵蓋數據采集與獲取、精 細化清洗與結構化解析、專 業標註體系等基礎工程;深 入剖析了數據合成與增強( 包括通用、代碼、全模態合 成)、多維度數據質量評估 等核心技術;探討了數據合 規監管、版權保護及安全隱 私等前沿議題。另外,書中 包含了一個基於PDF數據的 垂類模型能力提升實戰案例 ,幫助讀者打通從數據處理 到模型應用的完整鏈路。本 書適合人工智能領域的初學 者、科研工作者、算法工程 師及數據科學家閱讀。
作者簡介
何聰輝,清華大學博士,上海人工智能實驗室青年科學家、大模型數據負責人,商湯科技高級研究總監,入選第五屆上海科技青年35人引領計劃。深耕高性能計算與AI數據基礎設施的交叉領域,致力於構建面向通用人工智能的數據基座。在計算機科學會議上發表論文200餘篇,谷歌學術引用超1萬次。曾獲戈登·貝爾獎、ACL 2025最佳主題論文獎等多項榮譽。主導研發的智能文檔解析引擎MinerU,發布一年獲GitHub 5萬星標,調用量超10億次,被華為、阿裏、騰訊等百家企業采用。建立的評測基準OmniDocBench被Google Gemini和OpenAI GPT官方采納。曾構建大模型開放數據平臺OpenDataLab,其生態服務全球30萬名開發者。
目錄大綱
第1章 大模型數據概覽
1.1 數據驅動的大模型演進簡史
1.1.1 大模型進化路線
1.1.2 數據的重要性變遷
1.2 大模型數據的生命周期
1.2.1 生命周期總覽
1.2.2 生命周期的三大階段
1.3 大模型數據的四大關鍵維度
1.3.1 知識廣度
1.3.2 智能精度
1.3.3 泛化能力
1.3.4 新知洞察
1.4 大模型數據生態系統簡述
1.4.1 開源數據集生態
1.4.2 工具與平臺鏈路
1.4.3 數據治理與倫理邊界
第2章 大模型訓練所需數據來源
2.1 典型的數據來源
2.1.1 大模型訓練所需核心數據的類型
2.1.2 網絡爬取與社交媒體收集
2.1.3 數據共享平臺與協作機制
2.1.4 數據來源挑戰與演變
2.2 典型的公開數據集
2.2.1 預訓練數據集:通用知識構建
2.2.2 微調數據集:任務與領域適配
2.2.3 對齊強化數據集:對齊與價值塑造
2.3 數據獲取方式
2.3.1 公共渠道采集
2.3.2 眾包采集
2.3.3 智能體式采集
2.3.4 模型與仿真生成
第3章 數據標註與清洗
3.1 從原始數據到高質量語料
3.2 數據清洗:剔除噪聲與冗餘
3.2.1 數據過濾
3.2.2 數據去重
3.3 數據解析:從原始信息中恢覆結構與語義
3.3.1 結構化、半結構化與非結構化數據解析
3.3.2 代表性OCR工具
3.4 數據標註:從任務建模到質量保障
3.4.1 數據標註方式與策略體系
3.4.2 數據標註任務分類與體系
3.4.3 數據標註質量保障機制
3.5 小試牛刀
3.5.1 數據解析
3.5.2 數據清洗
3.5.3 數據重寫與增強
第4章 數據合成與增強
4.1 數據合成與增強的整體框架
4.2 數據合成方法
