Practical Generative AI: From Concept to Deployment

书籍基础信息

  1. 作者:Pramod Singh(贝恩亚太数据科学合伙人)、James McKeone(澳大利亚资深数据科学家)
  2. 出版社:Apress,出版年份 2026
  3. 核心定位:企业落地生成 AI 实操指南,覆盖从概念、数据、提示工程、模型微调、云端部署、行业落地全流程,兼顾技术实现与 AI 伦理合规,配套代码案例、架构图、行业案例,面向产品、架构师、算法、合规多类从业者
  4. 全书核心主线:生成 AI 不是单纯大模型调用,而是一套包含数据治理、提示、模型、运维、伦理、业务落地的完整工程体系,遵循「业务需求→POC→MVP→生产上线」完整落地生命周期,解决企业从 Demo 到稳定商用的各类痛点

第一章:引言

本章主要阐述了GenAI(生成式AI)的兴起原因、与传统AI的区别、道德AI的重要性以及AI代理的兴起。

一、GenAI兴起的原因

GenAI的指数级增长标志着人工智能发展的拐点。这并非巧合,而是模型架构突破、数据与算力可用性增加、消费者导向设计以及系统泛化和个性化能力提升共同作用的结果。从GPT-2到GPT-4o,模型能力从生成浅显内容发展到具备多模态、实时代理能力。Meta的LLaMA 3.1、Mistral的Mixtral等开源模型的出现,使得企业能够在防火墙后构建符合领域需求且合规的模型。

二、GenAI开发的“三步走”生命周期

GenAI应用开发是一个非线性的、多维度过程,分为三个主要阶段:

  1. 业务上下文理解:明确业务目标、用户、痛点及关键绩效指标(KPI),将需求分为L1(宏观目标)、L2(功能目标)和L3(详细规格)。
  2. 应用设计:设计用户角色、交互模式、对话流程及信任信号(如来源引用)。
  3. 解决方案架构:将业务愿景转化为工程执行,包括LLM API、向量数据库、提示编排层、文档管道、用户界面和反馈层。架构需支持非功能性需求,如延迟、可用性、吞吐量、可观测性和安全性。

三、传统AI与GenAI系统的范式对比

  1. 核心差异
    • 传统AI:基于结构化/半结构化数据,执行特定、有边界的任务(如欺诈检测),输出具有确定性。开发流程为数据清洗、特征工程、模型训练、验证和部署。强调模块化和可解释性。
    • GenAI:基于概率建模和自监督学习,设计用于生成新内容(文本、图像等)。输出具有创造性和不确定性。架构通常基于Transformer,能处理未经过滤的复杂输入。常被视为“黑盒”,计算资源需求高,部署成本较高。
  2. 数据要求
    • 传统AI:需要大量标记、结构化的数据集,对数据漂移敏感,需手动重训练。
    • GenAI:通常在自监督或无监督方式下训练,擅长处理非结构化数据。虽然也能进行微调,但其通用性往往通过提示工程和上下文学习实现。

四、AI的负责任和道德使用

随着AI应用日益广泛,必须建立强有力的治理框架。欧盟(EU)和经济合作与发展组织(OECD)已制定指导方针,强调技术稳健性、安全性、透明度和问责制。实施道德AI面临挑战,包括缺乏共识、偏见和决策过程的不透明性。关键考虑因素包括:

  1. 数据隐私:确保数据匿名化、透明存储,限制GenAI的使用,并采用隐私设计原则。
  2. AI中的偏见:通过代表性采样、多样化团队和偏差感知算法来缓解偏见。
  3. 透明度和可解释性:在准确性与可解释性之间取得平衡。可解释性AI(XAI)对于监管行业至关重要。

五、AI代理的兴起

Agentic AI(代理式AI)将LLMs嵌入到自主的、追求目标的实体中。

  1. 定义:AI代理是一个能感知环境、做出决策并执行行动以实现目标的系统,包含规划模块、记忆、工具使用、推理引擎和执行层。
  2. 与传统LLM应用的对比:代理具备主动性,能保持状态,迭代失败,使用外部工具(如API、数据库),而不仅仅是生成一次性响应。
  3. 当前应用:如AI研究助手、代码自动化代理、客户支持代理、财务分析代理等。
  4. 未来演进:向多代理协作(如AutoGen)、持久记忆和具身代理发展,同时加强治理与控制机制。

第二章:GenAI应用中的数据处理

本章强调,GenAI已将重心从模型训练转向数据编排,数据质量和管理是应用成功的关键。

一、GenAI系统的三个层次

  1. 语料库层:原始信息源,决定系统能力的边界。
  2. 知识层:通过解析、分块、元数据丰富、嵌入和索引,将原始数据转化为可检索的知识。
  3. 应用层:协调检索和生成,将用户查询转化为搜索请求并生成输出。

二、向量数据库:GenAI应用的中流砥柱

  1. 数据库演进:从处理结构化数据的SQL数据库,到处理半结构化/非结构化数据的NoSQL数据库,再到专为高维向量搜索优化的向量数据库。
  2. VectorDB核心组件
    • 向量索引:如HNSW、IVF、LSH,用于加速相似度搜索。
    • 距离度量:欧几里得距离、余弦相似度、点积相似度。
    • 分布式架构:支持水平扩展。
    • 存储优化:量化和压缩技术。
  3. 示例:使用SentenceTransformer和FAISS将文档转化为向量存储并检索相似内容。

三、处理不同类型的数据

  1. 结构化数据:需合并并转换为非结构化文本表示,以提高上下文相关性。
  2. 非结构化数据:如HTML、PDF、邮件,需解析并清洗,去除噪声(如页脚、导航栏)。
  3. 半结构化数据:如JSON、XML、Markdown,需选择性提取或保留潜在结构。
  4. 多模态数据:结合OCR提取图像文本、图像嵌入(如CLIP)和表格记录,建立并行索引并融合检索结果。

四、数据源获取与摄入

  1. 重要性:摄入决定了系统的完整性、新鲜度、合规性和来源可追溯性。
  2. 流程:统一异构源(网页、PDF、CSV)为标准文档对象,添加元数据(如来源、安全级别、时间戳)。
  3. 策略:采用批量处理或流式处理以平衡成本与实时性。处理重复内容,确保安全性(认证、授权、审计)。

五、数据准备与清洗

  1. 分块:将长文档分割为可检索单元。
    • 固定大小分块:简单但可能破坏语义。
    • 语义分块:按句子、段落等自然边界分割,保持语义连贯性。
    • 层级分块:创建多粒度分块(章节、段落、句子),支持不同粒度的查询。
    • 领域特定分块:根据特定内容类型(如法律合同、代码)调整策略。
  2. 元数据丰富化:为分块添加关键元数据(如源ID、文档类型、生效日期),用于过滤和治理。

六、处理GenAI应用中的PII(个人身份信息)

  1. PII分类
    • 直接标识符(P1):姓名、SSN、护照号等,需严格加密、掩码和访问控制。
    • 间接标识符(P2):邮箱、地址等,应进行伪名化或令牌化。
    • 低敏感度PII(P3):年龄、性别、邮编等,应匿名化或聚合处理。
  2. 处理技术
    • 数据匿名化:使用正则表达式或令牌化。
    • 数据脱敏:使用正则表达式永久隐藏敏感信息。
    • 云服务:如Microsoft Presidio、AWS Macie、Google DLP。
  3. GenAI聊天机器人中的PII处理流程:检测 -> 脱敏 -> 安全处理和存储 -> 安全检索 -> 响应掩码。

七、持续丰富与数据飞轮

  1. 重要性:GenAI系统需持续更新以保持相关性。
  2. 三个维度
    • 新鲜度:通过变更数据捕获(CDC)或事件驱动连接器实现增量更新。
    • 反馈:利用显式(点赞/点踩)和隐式反馈(停留时间、放弃率)改进检索和分块。
    • 漂移监控:监控查询、语料库和嵌入分布的漂移,通过可观测性工具跟踪指标。
  3. 内存:实现短期记忆(多轮对话)和长期记忆(个性化),作为额外的索引。
  4. 操作化:采用蓝绿部署策略,在生产环境测试新索引或嵌入模型,防止回归。

八、运营GenAI数据管道(LLMOps)

  1. 核心原则
    • 环境分离:开发、测试和生产环境必须隔离。
    • 可观测性:记录所有事件(摄入、检索、生成、反馈),监控指标(覆盖率、检索精确度、延迟、成本)。
    • 成本管理:通过缓存、修剪旧数据、压缩嵌入、批处理请求来控制成本。
    • 变更管理:使用蓝绿部署和金丝雀发布来安全更新模型或管道。
    • 运行手册:文档化常见故障处理流程。

九、演进历程与案例研究

  1. 演进:从2023年的朴素实验,到2024年的语义分块和混合检索,再到2025年的代理检索循环和多模态RAG,行业重心从模型转向数据管道质量。
  2. 案例研究
    • 销售赋能助手:通过改用语义分块和元数据标记,检索精确度提升38%。
    • 支持副驾驶:通过实施CDC,将摄入延迟从7天降至1小时,降低了投诉率。
    • 反模式:避免“索引所有内容”(噪声)、忽略重复、绕过治理(敏感数据泄露)、缺乏评估。

第三章:提示工程技巧

本章探讨了提示工程作为与LLM交互唯一界面的原则、技巧和实际案例。

一、关键原则

  1. 提示是引导LLM响应的唯一地方(除非从零构建或微调模型)。
  2. 提示使用自然语言。
  3. 不同语言模型的表现不同。
  4. 每次调用都是无状态的,上下文必须手动添加。
  5. LLM并非万能,不能解决所有问题(如精确计算)。

二、语言模型的陷阱

  1. 超出LLM能力的应用:依赖事实、计算、预测或上下文外知识。
  2. 依赖细致语境:LLM基于互联网训练,可能对高度技术性或小众领域回答错误。
  3. 忽视偏见或伦理:可能放大偏见,影响弱势群体。
  4. 提示中的歧义和冲突:导致输出不一致。
  5. 真正原创的内容:Transformer架构基于预测,难以生成真正新颖的内容。
  6. 忽视幻觉:模型可能生成看似合理但完全虚构的答案。

三、Token、嵌入和Token限制

  1. 文本被分解为Token进行输入输出。
  2. 嵌入模型将文本映射为捕获语义的向量。
  3. 需注意模型的Token限制以及符号对分词的影响。

四、提示的编写方式

  1. 通用提示技巧
    • 写完整句子:避免缩写和行话。
    • 意图清晰:使用明确的行为动词(如“提取”、“描述”)。
    • 简洁明了:避免冗长和模糊。
    • 赋予模型人设:定义模型的回复角色(如“你是一名结构工程师”)。
    • 定义语气:设定回复的风格和语调。
  2. 多模态和推理模型:无需特别改变提示方式,但应尽可能提供更多上下文以节省资源。
  3. RAG(检索增强生成):将检索到的相关分块插入提示中,需注意分块策略和检索质量。

五、案例研究:高级提示技巧练习

以电信公司通话记录摘要为例,逐步优化提示:

  1. 初始提示:简单要求总结通话记录。
  2. 添加结构:要求提取通话主题和三点摘要。
  3. 定义主题列表:限制主题为“销售”、“网络故障”、“投诉”或“其他”。
  4. 添加示例:在提示中包含示例输入输出对,提高性能。
  5. 要求JSON输出:使用JSON格式强制结构化输出,便于后续处理。
  6. 条件逻辑:根据主题(如“投诉”)动态添加额外的提示指令。
  7. 提示链:将复杂任务拆分为多个LLM调用链,如先分类主题,再根据主题生成不同的摘要。

第四章:评估GenAI应用

本章关注如何将想法转化为概念验证(POC),并介绍了在POC、试点和生产阶段的评估方法。

一、通向POC的陷阱

  1. 非GenAI用例:评估GenAI是否为最佳工具(如传统分类器成本更低)。
  2. 孤立构建,无用户测试:需尽早建立核心用户组。
  3. 使用模拟数据:可用于早期实验,但必须尽快转向真实数据以验证可行性。
  4. 处理敏感数据不当:必须在早期阶段解决网络安全和隐私问题。
  5. 等待下一个LLM发布:若价值主张成立,应立即构建,避免陷入“观望”。
  6. 未评估潜在危害:考虑误用、歧视和负面影响。

二、在POC阶段使用真实和模拟数据

使用LLM模拟数据结构而非内容,可以快速开始实验。但必须分析真实数据的变化和漂移,并尽快在真实数据上调优提示。

三、评估

  1. 用户评估
    • 建立多样化用户组:包括最终用户、领域专家(SME)和提示编写者。
    • 建立评估指标:定义清晰的成功标准(如准确性、遗漏率)。
    • 收集反馈:早期使用字面反馈,后期使用评分系统(二进制、0-3分、0-10分)。
    • 设定基线:与现有流程或A/B测试对比,设定目标阈值。
  2. LLM评估(LLM-as-judge)
    • 根据用户制定的评估标准编写评估提示。
    • 对于客观结果(如计算),应使用代码验证而非LLM。
    • 可以将复杂响应分解为多个组件分别评估。

四、案例研究:一个评估练习

以一家DIY商店的个性化建议应用为例:

  1. 核心用户组:包括经验丰富的员工、本地行业专家、新手员工和构建团队成员。
  2. 评估指标:创意相关性/实用性、创意原创性、报价相关性、报价准确性。
  3. 早期提示与迭代:定义工作类型,编写分类器和报价生成提示,迭代快速。
  4. 指标评分标准:为每个指标定义详细的0-3分或二进制评分细则。
  5. 成功基线:在POC阶段,通过人工完成少量任务并与应用输出对比来建立基线。
  6. 评估提示:编写一个LLM评估提示,根据用户输入和生成的内容,按照定义的指标进行评分和分类。

第五章:开源语言模型和微调

本章介绍了开源模型和微调技术,以及与传统ML微调的对比。

一、传统ML微调与LLM微调的对比

  1. 传统ML微调:调整超参数(如学习率、正则化),依赖小规模、任务特定的数据集,计算成本低,易于部署。
  2. LLM微调:调整大规模预训练模型以适应特定任务或领域,需要海量计算资源(GPU/TPU)。数据需求多样,可使用指令调优等技术。部署具有挑战性,常需专用基础设施。

二、何时微调LLM

当任务需要特定领域知识、特定语气风格或必须遵守特定指南时(如法律文本分析、医疗诊断、产品描述生成),微调是必要的。

三、LLM微调的类型

  1. 最后一层微调:仅更新模型最后一层,计算高效,风险低,但适应能力有限。
  2. 更深层次的微调:更新多层或全部层,能学习复杂任务特定表征,但计算成本高,易过拟合。
  3. 参数高效微调:如LoRA(低秩适应),冻结大部分参数,仅训练小规模适应层,平衡性能与资源消耗。
  4. 基于提示的微调:通过精心设计的提示或指令引导模型行为,不改变模型参数,资源消耗极低。

四、微调LLM的资源需求

  • 最后一层:低成本(~$50-$200),单GPU即可。
  • 更深层次:高成本(~$1000-$10000+),需要GPU集群。
  • LoRA:中等成本(~$100-$300),单GPU即可。
  • 基于提示:最低成本(~$50以下),消费级硬件即可。

五、微调后的性能提升

微调能显著提升领域特定任务的性能。例如,在法律合同分析中准确率提升25%,在医疗命名实体识别中F1分数提升15%。

六、微调示例

使用Hugging Face的trl库和LoRA方法微调Llama 3.2模型。通过提供模型名称、数据集和配置参数,可以启动微调过程。

七、开源LLM

  1. 组织决策标准:成本与复杂性、安全性(本地部署)、功能特性。
  2. 基础开源模型介绍
    • BERT:Google开发,双向编码器,适合文本分类和命名实体识别,但上下文窗口小(512 tokens)。
    • LLaMA:Meta开发,最新为LLaMA 3,支持多语言、编码、推理和工具使用。
    • Mistral/Mixtral:Mistral AI开发,采用稀疏混合专家模型,优化了性能与资源消耗的平衡。
    • Falcon:技术革新研究所开发,基于状态空间语言模型(SSLM),拥有无限上下文窗口。
  3. 标准化GenAI模型API:从OpenAI API向Hugging Face等平台的API标准化演进。

第六章:在云端构建GenAI应用

本章从架构和人员角度,探讨了从POC到MVP再到生产的云上构建过程。

一、GenAI应用的组件

  1. 架构差异:GenAI应用基于Transformer架构,处理非结构化数据,输出复杂内容,依赖提示管理和向量数据库存储。业务规则可通过提示工程动态融入。
  2. 核心构建模块
    • 数据源:内部和外部数据。
    • 数据摄入与存储:处理结构化和非结构化数据,存储在向量数据库。
    • 核心模块:包括RAG、语言处理、语义缓存、提示库。
    • GenAI模型层:基础模型(如GPT、Llama)。
    • 安全与合规:输出评估、PII处理。
    • 企业API层:统一的通信接口。
    • 用户界面:用户交互点。
    • 监控与评估:跟踪使用情况、成本和性能。

二、构建GenAI应用所需的人员要求

  1. 核心知识与技能
    • 业务洞察力:沟通、可视化、价值估算、变革管理。
    • 应用构建:数据科学/机器学习、提示工程、后端/前端编程、数据库、版本控制。
    • 平台工程:容器化与编排(Docker, Kubernetes)、云平台、网络与安全、CI/CD、基础设施即代码、监控与日志。
  2. 团队模式:以应用为中心、卓越中心(CoE)或混合模式。

三、开发阶段:POC、MVP和生产

  1. POC(概念验证)阶段
    • 目标:证明商业价值和技术可行性。
    • 重点:快速迭代,与核心用户组(2-7人)紧密合作,定义评估标准。使用快速响应的模型,可能使用虚拟数据。云架构简单,重点展示价值。
  2. MVP(最小可行产品)阶段
    • 目标:将演示应用转化为功能产品,供小规模真实用户测试。
    • 重点:构建核心后端,设置基础架构(如虚拟网络、缓存、日志),引入CI/CD。切换到生产模型,处理生产类数据。在单一区域和资源组中部署。
  3. 生产阶段
    • 目标:面向全部用户部署,实现商业价值。
    • 重点:确保安全性、可扩展性和可靠性。使用容器编排(如Kubernetes),完成企业集成,进行传统软件测试(负载测试、功能测试)。处理与真实数据源的连接。

四、各阶段的权衡

在各阶段中,需要在成本与性能、速度与结构、灵活性与简单性、用户体验与技术可行性、测试与质量之间进行权衡。应尽早采用托管服务,并从一开始就设计安全性、可扩展性、可靠性和可维护性。

第七章:商业用例与战略影响

本章概述了GenAI在企业中的现状、具体行业的应用案例以及战略考量。

一、GenAI在企业中的现状

大多数大型组织已超越探索阶段,开始进行广泛实验。虽然面临数据隐私、模型准确性、人才缺口等挑战,但成功模式正在涌现,如建立卓越中心。GenAI工具正通过无代码/低代码平台民主化。领导层正制定内部政策和框架。不同行业和地区的采用成熟度不同,同时需要关注员工技能提升和可持续性问题。

二、商业用例

  1. 金融与保险中的GenAI用例
    • 欺诈检测与预防:使用GAN等模型模拟和预测欺诈行为,如信用卡交易和保险索赔欺诈。
    • 个性化金融规划:基于实时数据生成动态、个性化的财务计划和投资策略。
    • 风险管理与情景分析:模拟各种风险情景(如利率上升、自然灾害),以辅助资本分配和承保决策。
    • 客户体验增强与聊天机器人:提供人性化的对话服务,回答复杂查询,自动化理赔流程。
    • 监管合规与报告:自动化KYC(了解你的客户)合规测试和监管报告生成。
  2. 医疗保健中的GenAI用例
    • 医学影像与诊断:分析MRI、CT等图像,高精度识别异常,生成详细报告。
    • 自动化MLR审查:加速医疗、法律和监管(MLR)审查流程,识别营销材料中的不合规内容。
    • 个性化治疗方案:基于患者基因组学和病史,为肿瘤学等领域推荐靶向疗法。
    • 药物发现与开发:生成新的候选药物分子,预测分子相互作用和ADME性质,加速药物发现。
    • 虚拟健康助手与患者监控:提供个性化医疗建议,提醒用药,监控生命体征。
  3. 采购与供应链中的GenAI用例
    • 增强需求预测与库存管理:分析多源数据(天气、社交媒体)生成准确预测,优化库存水平和补货策略。
    • 供应商选择:增强供应商评估过程,识别潜在风险(如破产、地缘政治不稳定)。

全书整体总结

  1. 完整落地链路:业务需求→伦理合规设计→多源数据治理(向量库 + PII 管控)→提示工程 / 微调优化模型输出→云端模块化架构搭建→分层评估体系→分阶段上线→多行业业务落地
  2. 两大核心认知 a. 数据管线是 GenAI 系统根基,大模型仅作为推理引擎,数据质量直接决定输出可靠性; b. 合规、隐私、伦理贯穿全流程,是企业生产环境不可省略的硬性约束
  3. 技术落地三层解决方案梯度(成本从低到高) ① 提示工程:快速落地、零训练成本; ② RAG 检索增强:利用企业私有数据,无需微调; ③ LoRA 微调:深度行业专属适配,适合长期垂直业务;
  4. 全书受众全覆盖:业务决策者看懂行业价值、架构师掌握云端模块化设计、算法工程师掌握数据 / 提示 / 微调实操、合规人员掌握隐私 AI 治理框架,配套大量可直接复用 Python 代码、架构示意图、行业案例。

发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注