第 3 章

生成式 AI 基础

⏱️ 180 分钟📚 Fundamentals of Generative AI难度: ⭐⭐
📝 35 题练习
备考助手

📖 生成式 AI 基础 (Fundamentals of Generative AI)

这一章对应 Domain 2: Fundamentals of Generative AI(24%),是整个 AIF-C01 考试中权重第二高的领域。如果说前两章是"地基",这一章就是"主体结构"——生成式 AI 是当前整个行业的核心热点,也是 AWS 考试出题最密集的区域之一。

从 ChatGPT 到 Stable Diffusion,从 Amazon Bedrock 到 CodeWhisperer,生成式 AI 正在重新定义我们与技术的交互方式。这一章会带你从底层原理到实际应用,把整个生成式 AI 的知识体系梳理清楚。


🎯 生成式 AI vs 传统 AI:根本区别是什么?

这是考试中一个高频考点——你必须清楚地区分 Generative AI 和 Traditional AI(尤其是 Discriminative AI)的本质区别。

Discriminative AI (判别式 AI)

Discriminative Model 学习的是"决策边界"——给定输入,判断它属于哪个类别。它回答的问题是"这是什么?"。

比喻:就像一个海关安检员,他只需要判断你的行李"是否有违禁品",不需要自己制造行李。

例子:

  • 垃圾邮件分类器:判断邮件是垃圾还是正常
  • 图像分类器:判断图片是猫还是狗
  • 情感分析:判断评论是正面还是负面

Generative AI (生成式 AI)

Generative Model 学习的是数据的"内在分布"——理解数据长什么样,然后能创造出全新的、符合这个分布的数据。它回答的问题不仅是"这是什么",更重要的是"我能创造什么"。

比喻:判别式 AI 像一个美食评论家,能鉴定菜品的好坏;生成式 AI 像一个厨师,能自己创造新菜品。评论家只需要评判,厨师需要真正理解食材和烹饪的规律。

例子:

  • 文本生成:写文章、写代码、翻译
  • 图像生成:根据描述创建图片
  • 代码生成:根据需求自动编写程序

核心对比

维度Discriminative AIGenerative AI
核心任务分类/预测创造新内容
学习内容决策边界 P(Y|X)数据分布 P(X) 或 P(X,Y)
输入→输出数据 → 标签/类别提示/条件 → 新内容
典型模型SVM, Logistic RegressionGPT, DALL-E, Stable Diffusion
比喻鉴定师创作者
AWS 服务Amazon Comprehend, RekognitionAmazon Bedrock, CodeWhisperer

⚠️ 考试重点: 考试可能会问"以下哪个是生成式 AI 的应用?"选项中会混入分类、预测等判别式任务。关键判断标准是:有没有创造新内容? 如果只是分类或预测已知类别,就不是生成式 AI。


💡 进化之路:从 RNN 到 Transformer

理解生成式 AI,你需要了解它的技术演进脉络。每一代架构的出现都是为了解决前一代的局限性。

RNN (Recurrent Neural Network,循环神经网络)

RNN 是最早处理序列数据(文本、语音、时间序列)的神经网络架构。它的核心特点是:有"记忆"——处理每个元素时,会考虑之前处理过的内容。

比喻:就像你逐字阅读一句话。读到每个字时,你都会结合前面读过的内容来理解当前这个字的含义。

致命缺陷: 短期记忆问题。RNN 在处理长序列时,早期的信息会逐渐"遗忘"。想象你读一本 500 页的书,读到最后一页时已经忘了第一页写了什么。这叫做 Vanishing Gradient Problem (梯度消失问题)

LSTM (Long Short-Term Memory,长短期记忆网络)

LSTM 是 RNN 的改进版,通过引入三个"门"结构(遗忘门、输入门、输出门)来控制信息的记忆和遗忘。

比喻:如果 RNN 是一个只能用脑子记事的人,LSTM 就是一个有笔记本的人。他可以选择性地记下重要信息(输入门)、划掉不重要的(遗忘门)、在需要时翻阅笔记(输出门)。

进步: 解决了 Vanishing Gradient Problem,能处理更长的序列。 局限性: 仍然是顺序处理,无法并行计算——处理一个词必须等前一个词处理完。这使得训练速度很慢,难以扩展到超大规模数据。

Transformer:改变一切的架构

2017 年 Google 发表了论文 "Attention Is All You Need",提出了 Transformer 架构。这篇论文彻底改变了 NLP 和整个 AI 领域的方向。GPT、BERT、Claude、LLaMA——所有你熟知的大语言模型都基于 Transformer。

Transformer 的革命性在于:它完全抛弃了 RNN 的顺序处理方式,用 Self-Attention Mechanism 实现了并行处理。

进化时间线

RNN (1980s)
  │  ✅ 能处理序列
  │  ❌ 短期记忆、无法并行
  ▼
LSTM (1997)
  │  ✅ 解决梯度消失、更长记忆
  │  ❌ 仍然顺序处理、训练慢
  ▼
Transformer (2017)
  │  ✅ 并行处理、全局注意力、可大规模扩展
  │  → GPT 系列 (Decoder-only): 文本生成
  │  → BERT (Encoder-only): 文本理解
  │  → T5 (Encoder-Decoder): 翻译、摘要
  ▼
Foundation Models (2020+)
     → GPT-4, Claude, LLaMA, PaLM
     → 百亿到万亿参数规模

⚠️ 考试重点: 考试会问 Transformer 相对于 RNN/LSTM 的优势。核心答案是两个:(1) 并行处理——训练速度快得多 (2) Self-Attention——能直接关注序列中任意位置的信息,不受距离限制。


🎯 Transformer 架构详解

Transformer 架构:Encoder-Decoder 结构详解

Transformer 是当前 AI 领域最重要的架构,你不需要理解每一个数学细节,但需要理解它的核心组件和工作原理。

整体结构

Transformer 由两个主要部分组成:

┌──────────────────────┐     ┌──────────────────────┐
│      Encoder          │     │      Decoder          │
│                        │     │                        │
│  ┌──────────────────┐ │     │ ┌──────────────────┐  │
│  │ Self-Attention    │ │     │ │ Masked            │  │
│  │                    │ │     │ │ Self-Attention     │  │
│  └──────────────────┘ │     │ └──────────────────┘  │
│          ↓             │     │         ↓              │
│  ┌──────────────────┐ │     │ ┌──────────────────┐  │
│  │ Feed-Forward      │ │────→│ │ Cross-Attention    │  │
│  │ Network           │ │     │ └──────────────────┘  │
│  └──────────────────┘ │     │         ↓              │
│                        │     │ ┌──────────────────┐  │
│  理解输入内容           │     │ │ Feed-Forward      │  │
│                        │     │ │ Network           │  │
└──────────────────────┘     │ └──────────────────┘  │
                              │                        │
                              │  生成输出内容           │
                              └──────────────────────┘
  • Encoder: 理解输入内容,提取其中的含义和关系。BERT 就是只用 Encoder。
  • Decoder: 基于理解的内容,逐步生成输出。GPT 就是只用 Decoder。
  • Encoder-Decoder: 两者结合,典型的翻译模型(如 T5)先理解源语言,再生成目标语言。

Self-Attention Mechanism (自注意力机制)

Self-Attention 机制:词与词之间的注意力权重分配

Self-Attention 是 Transformer 的灵魂。它让模型在处理一个词时,能"注意到"句子中所有其他词,并根据相关性分配不同的权重。

比喻:想象你在读一篇很长的文章。传统的 RNN 就像你被迫从头到尾逐字阅读,读到后面就忘了前面。Self-Attention 就像你面前有一本书的索引——你可以直接跳到任何相关的段落,了解上下文关系,不受距离限制。

举个具体例子,考虑这句话:

"The cat sat on the mat because it was tired."

"it"指的是什么?人类一眼就知道是"cat"。Self-Attention 的工作方式类似——它会计算"it"和句中所有其他词的关联度:

it → cat:     0.85  (高关联 ✓)
it → sat:     0.02
it → mat:     0.05
it → tired:   0.08

通过这种方式,模型能够正确理解"it"指代的是"cat"而不是"mat"。

Multi-Head Attention

实际的 Transformer 使用 Multi-Head Attention——同时运行多个 Self-Attention,每个"头"(Head) 关注不同的信息维度。

比喻:就像一个侦探组有 8 个侦探同时调查一个案件。一个关注时间线,一个关注人物关系,一个关注作案动机,一个关注物证。最后综合所有侦探的发现,得出更全面的结论。

Positional Encoding (位置编码)

因为 Self-Attention 是并行处理所有词的,它本身不知道词的顺序。"猫追狗"和"狗追猫"如果没有位置信息,对模型来说是一样的。

Positional Encoding 给每个词加上一个位置标记,让模型知道"这是第 1 个词"、"这是第 5 个词"。就像给队伍中的每个人发一个号码牌。

⚠️ 考试重点: 理解 Self-Attention 的核心价值——并行处理和全局关注。不需要背公式。如果题目问"Transformer 为什么比 RNN 训练更快",答案是 Self-Attention 允许并行计算。


💡 Tokenization:文字如何变成数字?

计算机不认识文字,只认识数字。Tokenization (分词/标记化) 是把文本拆分成模型能处理的最小单位(Token)的过程。

为什么需要 Tokenization?

模型不能直接处理 "Hello, how are you?" 这样的字符串。它需要先把文本拆成 Token,再把每个 Token 转换成数字(ID),才能送入神经网络计算。

常见 Tokenization 方法

Word-level Tokenization (词级)

最直观的方法:按空格和标点拆分。

"I love machine learning"
→ ["I", "love", "machine", "learning"]

问题: 词汇表会非常大,而且遇到没见过的词就无法处理(OOV,Out of Vocabulary)。

Character-level Tokenization (字符级)

按字符拆分。

"Hello"
→ ["H", "e", "l", "l", "o"]

问题: 序列变得很长,模型难以学习词义。

Subword Tokenization (子词级) — 目前主流

在词和字符之间找到平衡。常见的词保持完整,少见的词拆成更小的片段。

"unhappiness"
→ ["un", "happi", "ness"]

"playing"
→ ["play", "ing"]
BPE (Byte Pair Encoding)

BPE 是 GPT 系列使用的分词方法。它从字符开始,反复合并最频繁出现的字符对,直到达到预设的词汇表大小。

比喻:就像发明缩写。如果"the"出现了一万次,不如把它当成一个整体而不是三个字母。BPE 自动找到这些"值得缩写"的组合。

WordPiece

WordPiece 是 BERT 使用的分词方法,类似 BPE 但使用不同的合并策略(基于似然度而不是频率)。

"unbelievable"
→ WordPiece: ["un", "##believe", "##able"]
   (## 表示这个片段不是词的开头)

Token 和成本的关系

在使用大语言模型 API 时,Token 直接决定了费用。大多数 LLM 按 Token 数计费。一般来说,一个英文单词约等于 1-2 个 Token,一个中文字约等于 1-2 个 Token。

⚠️ 考试重点: 理解 Tokenization 的概念和意义即可。考试不会让你手动做 BPE 分词。重点是:(1) 为什么需要 Tokenization (2) Subword 方法的优势——在词汇量和序列长度之间取得平衡。


🎯 Embeddings:把词变成有意义的数字

Embedding (嵌入/向量化) 是把 Token 转换成固定长度的数字向量(一串数字)的过程。它不是简单地给每个词一个编号,而是把语义信息编码到数字中。

为什么不能用简单的编号?

如果"猫"=1,"狗"=2,"汽车"=100。这些数字暗示了"猫和狗的差距"等于"猫和汽车差距"的 1/99。但实际上,猫和狗的语义距离应该远小于猫和汽车。简单编号无法表达语义关系。

向量空间中的语义

Embedding 把每个词映射到一个高维向量空间中。在这个空间里,语义相似的词距离更近。

向量空间示意(简化为 2D):

     ↑ 维度2
     │
     │    ● king          ● queen
     │
     │         ● man   ● woman
     │
     │                        ● car
     │  ● cat                ● truck
     │  ● dog
     │
     └──────────────────────────→ 维度1

更神奇的是,Embedding 能捕捉类比关系:

king - man + woman ≈ queen
Paris - France + Japan ≈ Tokyo

这说明模型不仅学会了词的含义,还学会了词与词之间的关系。

Embedding 的实际维度

实际的 Embedding 不是 2D 或 3D,而是高维的:

  • Word2Vec: 100-300 维
  • BERT: 768 维
  • GPT-3: 12288 维

维度越高,能表达的语义信息越丰富,但也需要更多的计算资源。

AWS 中的 Embedding 服务

  • Amazon Bedrock: 提供 Titan Embeddings 模型,可以把文本转换成向量
  • Amazon OpenSearch: 支持向量搜索(Vector Search),用于语义检索

⚠️ 考试重点: 理解 Embedding 的核心概念——把文本转成向量,语义相似的文本在向量空间中距离更近。这是 RAG (Retrieval-Augmented Generation) 和语义搜索的基础,会在 Domain 3 中大量考查。


💡 Pre-training, Fine-tuning 与 RLHF Pipeline

大语言模型的训练不是一步完成的,而是一个多阶段的 pipeline。理解每个阶段的目的和方法对考试非常重要。

Stage 1: Pre-training (预训练)

Pre-training 是用海量无标注文本数据训练模型的阶段。模型通过预测下一个 Token(GPT 方式)或填充被遮住的 Token(BERT 方式)来学习语言的基本规律。

比喻:就像一个孩子在成长过程中大量阅读各种书籍。他不是为了做任何特定的事情,只是在积累对语言和世界的"通用理解"。

特点:

  • 数据量极大(TB 级别的文本)
  • 计算成本极高(数百万美元)
  • 学到的是通用知识,不是特定任务的技能
  • 通常只有大公司(AWS、OpenAI、Google)才有资源做

训练方式:

  • Causal Language Modeling (CLM): 预测下一个 Token。GPT 系列使用这种方式。
  • Masked Language Modeling (MLM): 随机遮住一些 Token,让模型预测被遮住的内容。BERT 使用这种方式。
CLM 示例:
输入: "The cat sat on the"
目标: "mat"

MLM 示例:
输入: "The [MASK] sat on the mat"
目标: "cat"

Stage 2: Fine-tuning (微调)

Fine-tuning 是在预训练模型的基础上,用特定领域或任务的标注数据进一步训练,让模型学会完成特定任务。

比喻:预训练后的模型就像一个通识教育毕业的大学生。Fine-tuning 就是让他读研究生,在特定领域(医疗、法律、金融)深造。他不需要从零学起,只需要在已有知识的基础上进行专业化训练。

Fine-tuning 的类型:

类型说明数据需求计算成本
Full Fine-tuning更新模型所有参数很高
LoRA (Low-Rank Adaptation)只更新少量新增参数较低
Adapter Tuning在模型中插入小型适配器层较低
Prompt Tuning只优化提示的 embedding

AWS 服务: Amazon Bedrock 支持对 Foundation Model 进行 Fine-tuning(Custom Model Training)。Amazon SageMaker 提供更灵活的 Fine-tuning 环境。

Stage 3: RLHF (Reinforcement Learning from Human Feedback)

RLHF 是让模型学习如何生成"人类偏好的"回答的训练方法。这是 ChatGPT 之所以"好用"的核心秘密之一。

比喻:Fine-tuning 让模型学会了"能做什么",RLHF 让模型学会了"怎么做才让人满意"。就像一个厨师不仅会做菜(Fine-tuning),还知道食客喜欢什么口味(RLHF)。

RLHF 的三步流程:

Step 1: 收集人类偏好数据
  → 给人类标注者展示同一问题的多个回答
  → 标注者排序哪个回答更好

Step 2: 训练 Reward Model (奖励模型)
  → 用人类偏好数据训练一个模型
  → 这个模型能自动给回答打分

Step 3: 用 RL 优化生成模型
  → 模型生成回答 → Reward Model 打分 → 模型学习生成更高分的回答
  → 使用 PPO (Proximal Policy Optimization) 等 RL 算法

完整 Pipeline 总结

Pre-training          Fine-tuning              RLHF
(海量无标注数据)     (特定任务标注数据)      (人类偏好数据)
     │                     │                      │
     ▼                     ▼                      ▼
学习语言基础知识  →  学习特定任务技能  →  学习生成人类偏好的输出
     │                     │                      │
 通用基础模型         专业领域模型           对齐的最终模型

⚠️ 考试重点: 区分 Pre-training、Fine-tuning 和 RLHF 的目的和数据需求。Pre-training 用无标注数据学通用知识(成本极高),Fine-tuning 用标注数据学特定任务(成本中等),RLHF 用人类反馈对齐偏好(需要人工标注者)。


🎯 生成式模型的类型

生成式 AI 不仅限于文本生成。它已经扩展到图像、代码、音频、视频等多个领域。

Text Generation (文本生成)

代表模型: GPT-4, Claude, LLaMA, Amazon Titan Text

文本生成模型基于 Transformer Decoder 架构,通过预测下一个 Token 来逐步生成文本。

应用场景: 写作辅助、翻译、摘要、问答、代码解释。

AWS 服务: Amazon Bedrock 提供多个文本生成模型(Anthropic Claude、Amazon Titan、AI21 Jurassic 等)。

Image Generation (图像生成)

代表模型: Stable Diffusion, DALL-E, Midjourney, Amazon Titan Image Generator

图像生成模型通常使用 Diffusion (扩散) 技术:先向图像添加噪声直到完全变成随机噪点,然后训练模型学会从噪声中"恢复"出图像。

比喻:就像雕塑。你从一块随机的石头(噪声)开始,一点点凿掉不需要的部分(去噪),最终得到一个精美的雕塑(生成的图像)。

应用场景: 产品设计、广告素材、概念可视化、艺术创作。

AWS 服务: Amazon Bedrock 提供 Stability AI (Stable Diffusion) 和 Amazon Titan Image Generator。

Code Generation (代码生成)

代表模型: CodeWhisperer (AWS), GitHub Copilot, Code Llama

代码生成模型是在大量代码数据上 Fine-tuning 的文本生成模型。它们理解编程语言的语法、逻辑和最佳实践。

应用场景: 代码补全、代码生成、Bug 修复、代码解释、测试用例生成。

AWS 服务: Amazon CodeWhisperer(现已更名为 Amazon Q Developer)提供实时代码建议。

Multi-modal Models (多模态模型)

Multi-modal Model 能同时处理和生成多种类型的数据——文本、图像、音频、视频等。

比喻:早期的 AI 像是只有单一感官的人——有的只能"看"(图像模型),有的只能"读"(文本模型)。Multi-modal Model 就像一个五感健全的人,能同时看、听、读、写。

代表模型: GPT-4V (文本+图像), Gemini (文本+图像+音频+视频)

AWS 服务: Amazon Bedrock 上的 Claude 3 系列支持多模态输入(文本+图像)。

生成式模型类型对比

类型输入输出代表模型AWS 服务
Text文本提示文本GPT-4, ClaudeAmazon Bedrock
Image文本描述图像Stable DiffusionBedrock (Stability AI)
Code注释/需求代码CodeWhispererAmazon Q Developer
Multi-modal文本+图像文本/图像Claude 3, GPT-4VBedrock (Claude 3)

💡 Prompt Engineering:与模型对话的艺术

Prompt Engineering (提示工程) 是设计和优化输入提示,以从语言模型中获得更好输出的技术和策略。这不仅是一项实用技能,也是 AIF-C01 考试的重要考点。

Zero-shot Prompting (零样本提示)

Zero-shot 是直接给模型一个任务描述,不提供任何示例。模型仅凭预训练中学到的知识来回答。

Prompt: "将以下文本翻译成英文: 今天天气很好"

Output: "The weather is nice today"

适用场景: 任务简单明确,模型的预训练知识足以处理。

Few-shot Prompting (少样本提示)

Few-shot 是在 Prompt 中给出几个示例(通常 2-5 个),让模型从示例中理解你期望的输入-输出格式和任务要求。

Prompt:
"判断以下评论的情感:

评论: '这个产品太棒了!' → 正面
评论: '质量很差,很失望' → 负面
评论: '包装不错,但功能一般' → ?"

Output: "中性"

适用场景: 需要模型按特定格式输出,或任务有一定复杂度。

Prompt Chaining 工作流:将复杂任务拆成多个可控子步骤

这张图用于理解“复杂任务分解”考点:当单个 Prompt 不稳定时,拆成多段链式提示通常更容易拿到稳定结果。

比喻:Zero-shot 像是把一个任务描述扔给同事,希望他自己理解。Few-shot 像是先做几个示范,再让他照着做——成功率自然高得多。

Chain-of-Thought (CoT) Prompting (思维链提示)

Chain-of-Thought 是引导模型在回答前先展示推理过程的技术。通过让模型"一步步想",能显著提高复杂推理任务的准确率。

普通 Prompt:
"如果一个商店有 15 个苹果,卖出 7 个,又进了 12 个,现在有多少?"

Chain-of-Thought Prompt:
"如果一个商店有 15 个苹果,卖出 7 个,又进了 12 个,现在有多少?
请一步一步思考。"

模型回答:
"让我一步步计算:
1. 开始有 15 个苹果
2. 卖出 7 个:15 - 7 = 8 个
3. 又进了 12 个:8 + 12 = 20 个
所以现在有 20 个苹果。"

为什么有效? 因为语言模型是逐 Token 生成的。让模型先生成推理步骤,相当于让它"思考"——每一步的输出都成为下一步推理的上下文。

Auto-CoT 流程图:先自动构造思维链示例,再用于推理任务

这张图补充了 CoT 的进阶形态:考试若出现“如何在复杂推理任务中稳定提升表现”,可联想到 CoT/Auto-CoT 方案。 Function Calling 流程:模型决策与外部工具执行协同

这张图用于理解“模型会调用工具但不直接执行”的考点,适合区分 LLM 推理与外部系统执行边界。

Prompt Engineering 策略对比

策略提供示例适用场景复杂度
Zero-shot0 个简单任务、常见任务
One-shot1 个格式化输出
Few-shot2-5 个特定格式、领域任务
Chain-of-Thought可选推理、数学、逻辑
System PromptN/A设定角色和约束低-中

⚠️ 考试重点: 考试会给你一个场景,让你选择最合适的 Prompting 策略。如果任务涉及推理和计算,Chain-of-Thought 是首选。如果需要特定输出格式,Few-shot 是首选。如果任务简单直接,Zero-shot 就够了。

Prompt Routing 流程:按问题类型分发到不同提示模板或专家链路

这张图对应“路由策略”场景:题目出现多任务混合输入时,先路由再生成往往比单模型硬答更稳。


🎯 Temperature, Top-P, Top-K:控制生成的"创造力"

这三个参数控制模型生成文本时的"随机性"和"创造力"。理解它们对于使用 Amazon Bedrock 等服务至关重要。

Temperature (温度)

Temperature 控制生成结果的随机性。值越高,输出越多样和有创意;值越低,输出越确定和保守。

比喻:Temperature 就像一个"创意旋钮"。开到最低(0),模型总是给你最"安全"的答案(就像一个保守的会计师)。开到最高(1 或以上),模型开始"天马行空"(就像一个充满灵感的艺术家)。

Temperature 值效果适用场景
0完全确定性,每次输出一样事实回答、代码生成
0.1-0.3很保守,偶有小变化翻译、摘要
0.4-0.7平衡创意和准确性对话、写作
0.8-1.0高创意,多样性强创意写作、头脑风暴
>1.0非常随机,可能不连贯很少使用

Top-P (Nucleus Sampling,核采样)

Top-P 设置一个累积概率阈值。模型只从概率之和达到 P 值的最小 Token 集合中采样。

举例:如果 Top-P = 0.9,模型会找到概率最高的若干 Token,直到它们的概率之和达到 90%,然后只从这些 Token 中选择。剩下的 10% 概率的 Token 被排除,它们通常是低概率的"离谱"选项。

Token 概率排列:
"happy" = 0.40
"glad"  = 0.25
"joyful" = 0.15
"elated" = 0.10
"potato" = 0.05  ← Top-P=0.9 会排除这个
"banana" = 0.03  ← 以及这个
"xyz"    = 0.02  ← 以及这个

Top-K

Top-K 更简单直接:只从概率最高的 K 个 Token 中选择。

  • Top-K = 1: 只选概率最高的 Token(贪心解码,完全确定性)
  • Top-K = 10: 从概率最高的 10 个 Token 中选择
  • Top-K = 50: 更大的选择范围,更多样的输出

三个参数的关系

参数控制什么值小时值大时
Temperature概率分布的"平坦度"更确定更随机
Top-P候选 Token 的概率范围更保守更多样
Top-K候选 Token 的数量更保守更多样

实践建议:

  • 通常只调 Temperature 和 Top-P 中的一个,不同时调
  • 事实性任务:Temperature=0, Top-P=1
  • 创意任务:Temperature=0.7-0.9, Top-P=0.9-0.95

⚠️ 考试重点: 如果题目描述"模型输出太随机/不可预测",答案是降低 Temperature 或 Top-P/Top-K。如果描述"模型输出太单调/重复",答案是提高这些参数。这是非常直接的场景题。


💡 Hallucination:模型为什么会"胡说八道"?

Hallucination (幻觉) 是指模型生成的内容看起来很合理,但实际上是事实错误的或完全捏造的。这是当前生成式 AI 最大的挑战之一,也是考试中 Responsible AI 相关的核心考点。

为什么会产生 Hallucination?

  1. 训练数据不完整: 模型的知识来源于训练数据。如果训练数据中没有某个事实,模型只能"猜测",而它的"猜测"可能看起来很有道理却完全错误。

  2. 模型本质是模式匹配: 语言模型本质上是在预测"什么 Token 最可能出现在这里"。它不是在"理解"事实,而是在做统计推测。如果"张三是诺贝尔奖获得者"这种表述在统计上"合理",模型就可能生成它,不管张三是否真的获过奖。

  3. 知识截止日期: 模型的训练数据有截止日期,对于此后发生的事件一无所知,但可能会"自信地"给出错误答案。

  4. 缺乏事实验证机制: 模型在生成时没有内置的"事实检查器"。它只关注语言的流畅性和连贯性,不关注事实准确性。

Hallucination 的类型

类型说明例子
事实性错误生成错误的事实信息"澳大利亚的首都是悉尼"(应该是堪培拉)
捏造引用编造不存在的论文/文献引用一个根本不存在的研究论文
逻辑矛盾前后说法不一致先说A是对的,后面又说A是错的
过度自信对不确定的事情给出确定性答案对一个有争议的话题给出绝对性结论

如何缓解 Hallucination?

方法说明AWS 相关
RAG (Retrieval-Augmented Generation)让模型在生成前先检索相关文档,基于事实来回答Amazon Bedrock Knowledge Bases
Grounding (接地)把模型的回答锚定在可验证的数据源上Amazon Kendra + Bedrock
温度调低降低 Temperature 减少随机性Bedrock API 参数
Prompt 设计明确告诉模型"如果不确定就说不知道"Prompt Engineering
Human-in-the-loop人工审核模型输出Amazon A2I (Augmented AI)
Fine-tuning用高质量数据微调,减少错误知识SageMaker / Bedrock
Guardrails设置输出过滤和验证规则Amazon Bedrock Guardrails

⚠️ 考试重点: RAG 是 AWS 官方推荐的缓解 Hallucination 的首选方法。如果考试问"如何减少模型幻觉",RAG 几乎一定是正确答案之一。另外,Bedrock Guardrails 也是一个重要的安全机制。


🎯 考试场景对比表

场景 → 模型类型选择

考试场景描述推荐模型类型原因
需要生成营销文案Text Generation (LLM)创造新的文本内容
需要根据描述生成产品图片Image Generation (Diffusion)从文本生成图像
需要自动完成代码Code Generation基于上下文生成代码
需要同时理解图片并回答问题Multi-modal Model处理多种数据类型
需要判断邮件是否为垃圾邮件Discriminative Model分类任务,非生成任务
需要发现客户购买模式Unsupervised ML模式发现,非生成任务

场景 → Prompt 策略选择

考试场景描述推荐策略原因
简单翻译任务Zero-shot任务简单明确
需要特定 JSON 输出格式Few-shot示例展示期望格式
复杂数学推理Chain-of-Thought需要逐步推理
需要稳定一致的回答Temperature=0消除随机性
创意写作,需要多样性Temperature=0.8+增加随机性

场景 → 训练策略选择

考试场景描述推荐方法原因
从零开始构建 LLMPre-training需要完整训练(成本极高)
让通用模型适应医疗领域Fine-tuning在已有模型基础上专业化
让模型回答更像人类偏好RLHF对齐人类偏好
减少模型幻觉RAG基于检索的事实锚定
低成本适应新领域LoRA / Prompt Tuning参数高效的微调方法

场景 → 问题解决

考试场景描述问题解决方案
模型生成的内容事实错误HallucinationRAG、Guardrails、降温
模型输出太随机不稳定高随机性降低 Temperature/Top-P
模型输出太重复单调低多样性提高 Temperature/Top-P
模型不理解特定领域术语领域知识不足Fine-tuning 或 RAG
模型输出不安全/有害内容安全问题Bedrock Guardrails

📚 本章小结

本章覆盖了 AIF-C01 考试 Domain 2(24%权重)的核心内容。这是整个考试中最与时俱进的部分,也是最容易拉开分数差距的领域:

  1. Generative AI vs Discriminative AI: 生成式 AI 创造新内容,判别式 AI 做分类预测。关键判断标准是"是否创造了新内容"。
  2. 技术进化路线: RNN → LSTM → Transformer。Transformer 的核心优势是并行处理和 Self-Attention。
  3. Transformer 架构: Encoder(理解)+ Decoder(生成),Self-Attention 让模型能关注任意位置的信息。GPT 用 Decoder,BERT 用 Encoder。
  4. Tokenization: 文本→Token→数字。BPE (GPT) 和 WordPiece (BERT) 是主流方法。Subword 方法在词汇量和序列长度之间取得平衡。
  5. Embeddings: 把 Token 变成有意义的数字向量。语义相似的词在向量空间中距离更近。这是 RAG 和语义搜索的基础。
  6. 训练 Pipeline: Pre-training(通用知识)→ Fine-tuning(特定任务)→ RLHF(人类偏好对齐)。
  7. 生成式模型类型: Text (GPT/Claude)、Image (Stable Diffusion)、Code (CodeWhisperer)、Multi-modal (Claude 3/GPT-4V)。
  8. Prompt Engineering: Zero-shot(无示例)、Few-shot(有示例)、Chain-of-Thought(逐步推理)。
  9. 生成参数: Temperature(创意旋钮)、Top-P(概率阈值)、Top-K(候选数量)。低值=保守确定,高值=创意多样。
  10. Hallucination: 模型生成看似合理但实际错误的内容。RAG 是 AWS 推荐的首选缓解方法。

下一章预告: 我们将进入考试权重最高的 Domain 3——基础模型应用(28%)。Amazon Bedrock、Foundation Models、RAG 架构、Agent 系统等实战内容将全面展开。这是与 AWS 服务结合最紧密的章节。


🔗 参考资源

📝 章节练习 (35 题)
开始练习