Skip to content
Gains Summary
Main Navigation 首页 / Home
C++ 编程 / C++ Programming
系统与高性能 / Systems & Performance
Web 开发 / Web Development
人工智能 / Artificial Intelligence
工业软件 / Industrial Software
其他内容 / Other Topics
C++ 编程 / C++系统与性能 / SystemsWeb 开发 / Web人工智能 / AI工业软件 / Industrial

外观

Sidebar Navigation

人工智能 / Artificial Intelligence

AI 工程:LLM、Agent 与基础设施 / AI Engineering with LLMs, Agents, and Infrastructure

大语言模型 / Large Language Models

LLM 前置知识学习路线 / A Prerequisite Learning Path for Large Language Models

神经网络基础 - 从零理解 AI 的"计算单元" / Neural Network Fundamentals from Artificial Neurons

Token 与上下文窗口 - LLM 的计费与记忆单位 / Tokens and Context Windows as the Units of LLM Cost and Memory

解码策略 - 控制 LLM 输出的艺术 / Decoding Strategies for Controlling LLM Output

消息角色 - 构建 Agent 对话的基础 / Message Roles as the Foundation of Agent Conversations

流式输出 - 实时交互的体验优化 / Streaming Output for Responsive Interaction

Prompt 工程基础 - 与 LLM 高效对话的技巧 / Prompt Engineering Fundamentals for Effective LLM Interaction

LLM 进化史 - 从词向量到 Transformer / The Evolution of LLMs from Word Embeddings to Transformers

Transformer 手动计算:从 Attention 到 Encoder-Decoder 完整数据流

Transformer 核心原理 - 现代 LLM 的基石 / Transformer Fundamentals Behind Modern LLMs

Decoder-Only LLM 深度解析:为什么扔掉 Encoder,以及 KV Cache 如何工作

训练 vs 推理:同一个 Transformer,两条完全不同的执行路径

Transformer 训练阶段计算详解 - 手算每一行矩阵 / Transformer Training Computation Matrix by Matrix

Transformer 推理阶段详解 — 模型如何"思考"并生成回答 / Transformer Inference and Autoregressive Generation

训练基础扫盲 - 理解 Fine-tune 在做什么 / A Training Primer for Understanding Fine-Tuning

LLM 预训练全景:数据管道、Scaling Laws 与训练稳定性

训练基础设施 - 从单卡到千卡集群 / Training Infrastructure from One GPU to Thousand-GPU Clusters

Post-Training Pipeline - 从 Base Model 到可用助手 / The Post-Training Pipeline from Base Model to Assistant

SFT 深度解析:从 Base Model 到指令跟随——后训练第一步 / SFT Deep Dive: Teaching Base Models to Follow Instructions

RLHF 深度解析:从 Reward Model 到 PPO 的完整对齐流程

DPO 与对齐方法:从 RLHF 复杂度到直接偏好优化

研究视角:DL/RL 理论到 LLM 训练的完整映射

智能体工程 / Agent Engineering

Agent 工程体系全景 / Agent Engineering System Overview

Function Calling - 让 LLM 具备行动能力 / Function Calling for Giving LLMs the Ability to Act

Agent 框架演进 - 从裸 SDK 到 LangGraph / The Evolution of Agent Frameworks from Raw SDKs to LangGraph

RAG 基础 - 让 Agent 拥有"知识" / Retrieval-Augmented Generation Fundamentals for Agent Knowledge

记忆管理 - Agent 的大脑 / Memory Management as the Brain of an Agent

Agent 工作流 - 从单步到复杂的执行编排 / Agent Workflows from Single Steps to Complex Orchestration

多 Agent 系统 - 多个 Agent 协作 / Multi-Agent Systems and Agent Collaboration

RAG 进阶 - 企业级知识库实战 / Advanced RAG for Enterprise Knowledge Bases

真实 Agent 应用场景 / Real-World AI Agent Applications

Structured Output - 让 LLM 输出可控的结构化数据 / Structured Output for Controllable, Machine-Readable LLM Responses

Tools Design Best Practices - AI Agent 工具设计最佳实践 / Tools Design Best Practices for AI Agents

Agent 架构模式 - 从单 Agent 到多 Agent 的工程范式 / Agent Architecture Patterns

Agent Modes — 编程 Agent 的交互模式设计 / Designing Interaction Modes for Coding Agents

Agent Workflow 编排:从循环到持久化执行的演进

Context Engineering - 从 Prompt 设计到上下文编排 / Context Engineering: From Prompt Design to Context Orchestration

Agent 缓存工程:从 KV Cache、Prompt Cache 到语义缓存 / Agent Caching Engineering

Harness Engineering, Skills, and Loop Engineering — 从信任模型到验证系统 / From Trusting Models to Verifying Systems

MCP 协议 - AI 工具的"USB 接口" / Model Context Protocol for AI Tool Integration

Agent 评估与测试 — 如何衡量一个"不可预测"的系统 / Agent Evaluation and Testing — How to Measure an "Unpredictable" System

安全沙箱 - Agent 的安全边界 / Secure Sandboxes as Agent Safety Boundaries

权限与门卫 - Agent 的安全控制中枢 / Permissions and Policy Gates for Agent Control

API Key 管理与安全 - Agent 的密钥生命周期的管理 / API Key Lifecycle Management and Security for Agents

提示词注入防护 - Agent 的防御前沿 / Prompt Injection Defense for AI Agents

可观测性与调试 - Agent 运行的透明度保障 / Observability and Debugging for Transparent Agent Operations

模型路由 - 让正确的模型做正确的事 / Model Routing for Matching Models to Tasks

OpenClaw 设计深度分析 - 为什么它让人觉得"活"了 / OpenClaw Design Analysis and the Illusion of Liveliness

Claude Code 泄露源码深度分析 - 512,000 行代码揭示的生产级 Agent 架构 / Claude Code Source Analysis and Production Agent Architecture

LobeChat 设计深度分析 - 全栈 Agent Chat 应用工程实践 / LobeChat Design Analysis and Full-Stack Agent Chat Engineering

编程 Agent 全面对比:从 Claude Code 到 Pi 的设计哲学 / Coding Agents Comparison: Design Philosophies from Claude Code to Pi

领域 Agent 的确定性工具编译与延迟执行——从自然语言规格到单次 CAE 提交

Agent 工程学习指南 / An AI Agent Engineering Learning Guide

AI 基础设施 / AI Infrastructure

集群基础设施 / Cluster Infrastructure

GPU 集群基础设施全景——训练框架之下、硬件之上的那一层 / GPU Cluster Infrastructure Between Training Frameworks and Hardware

GPU 集群硬件架构——从 NVLink 到 InfiniBand / GPU Cluster Hardware from NVLink to InfiniBand

异构硬件生态——CPU/DPU/NPU 的集群角色 / Roles of CPUs, DPUs, and NPUs in Heterogeneous Clusters

GPU 虚拟化与资源隔离——一张卡多人用 / GPU Virtualization and Resource Isolation

作业调度系统——Kubernetes 和 Slurm / Job Scheduling with Kubernetes and Slurm

多作业与多租户管理——让集群被所有人高效使用 / Multi-Job and Multi-Tenant Cluster Management

网络架构与 RDMA——让 GPU 之间的通信更快 / Network Architecture and RDMA for Faster GPU Communication

NCCL 集群组网——大规模集合通信调优 / NCCL Cluster Networking and Collective Communication Tuning

分布式存储——让数据跑得比 GPU 快 / Distributed Storage That Keeps GPUs Fed with Data

集群运营与故障处理——让万卡集群稳定运行 / Operations and Failure Recovery for Large GPU Clusters

训练系统 / Training Systems

AI Infra 训练侧全景——让千亿参数模型跑起来需要什么 / Training-Side AI Infrastructure for Hundred-Billion-Parameter Models

GPU 硬件基础——为什么 GPU 比 CPU 快,显存为什么总是不够 / GPU Hardware, Parallel Throughput, and Memory Capacity

分布式训练——如何把大模型分到多张卡上 / Distributing Large-Model Training Across Multiple GPUs

显存优化——让 70B 模型在有限显存中跑起来 / Memory Optimization for Running 70B Models

混合精度与通信——BF16 为什么是 LLM 训练的主流选择 / Mixed Precision and Communication with BF16

预训练——Scaling Laws、数据工程与训练稳定性 / Pretraining with Scaling Laws, Data Engineering, and Stability

后训练 SFT——从预训练模型到助手模型 / Supervised Fine-Tuning from Pretrained Model to Assistant

后训练 RLHF/DPO——从助手模型到对齐模型 / RLHF and DPO from Assistant Model to Aligned Model

高效微调——LoRA 和 QLoRA 让大模型走进消费级 GPU / Efficient Fine-Tuning with LoRA and QLoRA on Consumer GPUs

训练工程——千卡集群的管理与故障恢复 / Training Engineering for Thousand-GPU Cluster Operations and Recovery

AI 编译器 / AI Compilers

AI 编译器全景——为什么模型需要编译器 / The AI Compiler Landscape and Why Models Need Compilers

编译原理速通——面向 ML 工程师的核心概念 / Compiler Fundamentals for Machine Learning Engineers

中间表示基础——理解 IR 层级与 lowering 链路 / Intermediate Representation Levels and Lowering Pipelines

计算图的构建与表示 / Building and Representing Computational Graphs

MLIR 架构、方言与渐进式降级 / MLIR Architecture, Dialects, and Progressive Lowering

算子语义、广播、归约与形状推导 / Operator Semantics, Broadcasting, Reduction, and Shape Inference

模型前端格式:ONNX、TFLite、HLO 与 SavedModel / Model Frontend Formats: ONNX, TFLite, HLO, and SavedModel

图优化 Pass——经典优化在 ML 中的应用 / Graph Optimization Passes for Machine Learning

算子融合——编译器最重要的性能优化 / Operator Fusion as a Core Compiler Optimization

内存规划——Buffer 分配与生命周期管理 / Memory Planning, Buffer Allocation, and Lifetime Management

Layout 优化——数据排布转换与内存效率 / Layout Optimization for Data Movement and Memory Efficiency

动态 Shape——符号分析与形状处理 / Dynamic Shapes, Symbolic Analysis, and Shape Processing

硬件约束下的操作调度 / Operation Scheduling Under Hardware Constraints

从模板、DSL 到 IR 降级的代码生成架构 / Code Generation Architectures from Templates and DSLs to IR Lowering

CPU 后端:SIMD、分块与多线程 / CPU Backends with SIMD, Tiling, and Multithreading

CUDA 后端:合并访存与 Tensor Core / CUDA Backends, Memory Coalescing, and Tensor Cores

NPU 后端:脉动阵列与端侧 AI 生态 / NPU Backends, Systolic Arrays, and Edge AI Ecosystems

Kernel 性能基础:Roofline 与 Occupancy / Kernel Performance Fundamentals with Roofline and Occupancy

CUTLASS 与分层 GEMM 模板 / CUTLASS and Hierarchical GEMM Templates

TVM Tensor Expression 与计算调度分离 / TVM Tensor Expressions and Compute-Schedule Separation

使用 Triton 编写高性能 GPU Kernel / Triton for High-Performance GPU Kernels in Python

基于成本模型与实测搜索的自动调度 / Automatic Scheduling with Cost Models and Measurement-Based Search

XLA 内部机制:HLO、融合与 SPMD / XLA Internals, HLO, Fusion, and SPMD

Torch-MLIR:从 PyTorch 算子到 MLIR 方言 / Torch-MLIR from PyTorch Operators to MLIR Dialects

torch.compile:Dynamo、AOTAutograd、Inductor 与 Triton / Torch Compile with Dynamo, AOTAutograd, Inductor, and Triton

从 MLIR 经 LLVM 降级到机器码 / Lowering from MLIR Through LLVM to Machine Code

量化——低精度推理的工程实践 / Engineering Low-Precision Inference with Quantization

分布式编译与训练——多设备编排的编译器支持 / Compiler Support for Distributed Training and Multi-Device Orchestration

生产调试——真实问题的编译器视角排查 / Production Debugging from the Compiler Perspective

未来方向——AI 编译器的新挑战与机遇 / Future Challenges and Opportunities for AI Compilers

本页目录

AI 工程:LLM、Agent 与基础设施 / AI Engineering with LLMs, Agents, and Infrastructure ​

AI 专题分成三条互相依赖、但不重复讲解的主线:

AI 工程不等于调用一次模型接口。一个可用系统同时包含模型能力、数据与上下文、确定性程序、计算基础设施和验证闭环。模型输出具有概率性,外围系统就必须用结构化协议、权限、超时、评估和人工确认把不确定性限制在可接受范围内。

text
模型层:神经网络 → Transformer → 训练、推理与后训练
应用层:LLM API → Tool → RAG / Memory → Workflow / Multi-Agent
系统层:GPU 集群 → 分布式训练 → AI 编译器 → 部署与可观测性
1
2
3

模型层解释“模型如何工作”,Agent 层解释“如何组成可靠应用”,Infra 层解释“如何高效地训练和运行”。同一概念只在所属层完整说明,其他层通过链接引用。

从数据到产品的完整链路 ​

text
数据与任务定义
      │
      v
训练 / 微调 / 后训练 -> 模型权重与推理接口
      │                         │
      │                         v
评估集与安全测试          Prompt、RAG、Tool、Workflow
      │                         │
      └────────质量门禁 <───────┤
                                v
                    部署、路由、监控与反馈
1
2
3
4
5
6
7
8
9
10
11

训练指标好不代表产品任务可靠,单次演示成功也不代表系统可以上线。任务首先需要可观察的成功标准,例如答案正确率、工具执行成功率、引用覆盖率、延迟、成本和高风险误操作率。开发过程围绕固定评估集迭代,生产环境再监控输入分布、模型版本、工具错误和用户反馈。没有评估闭环的“提示优化”很难判断是真进步还是偶然样本。

四个层次各自解决什么 ​

LLM 模块解释 Token、Embedding、Transformer、训练目标、推理和后训练,使读者知道能力与限制来自哪里。Agent 模块讨论如何把模型放入循环,让它读取上下文、选择工具、处理结果并停止;重点是状态、权限、错误和确定性执行,而不是把模型拟人化。基础设施模块处理数据管线、GPU 集群、并行训练、存储、网络和故障恢复。编译器模块把高层计算图转换为适合具体硬件的 Kernel 与内存计划。

这些层次通过明确接口协作。应用不应假定模型永远输出合法 JSON,推理服务不应让任意租户耗尽显存,训练任务不应把 Checkpoint 成功写入等同于所有副本都持久化,编译优化也必须保持数值容差和动态形状语义。

1. AI 工程的五层边界 ​

一个完整 AI 系统可以拆成五层:

text
任务与产品层
  -> 数据与评估层
  -> 模型与推理层
  -> Agent / Workflow 应用层
  -> 训练、部署与编译基础设施层
1
2
3
4
5

任务层定义系统要完成什么,以及失败会造成什么影响。 如果任务没有可观察的成功标准,后续模型比较就没有方向。

数据与评估层保存输入分布、标准答案、评分规则和安全样本。 它负责判断修改是真改善,还是只在少量演示样本上表现更好。

模型层提供概率性生成、分类、Embedding 或多模态能力。 模型输出不是可信事实,也不是已经执行的业务命令。

应用层把模型放入受控程序:

  • 选择上下文;
  • 注册工具;
  • 校验结构化输出;
  • 管理循环和停止条件;
  • 处理重试、超时和人工确认;
  • 保存 Trace 与审计记录。

基础设施层负责训练、推理服务、GPU 集群、存储、网络、编译和监控。 它必须在吞吐、延迟、成本和可靠性之间取舍。

五层可以独立演进,但接口必须清晰。 模型升级不能绕过权限,基础设施优化不能改变任务语义,评估也不能只测模型而忽略完整工具链。

2. 从任务定义开始 ​

AI 项目最常见的错误是先选模型,再寻找可以展示的任务。 更可靠的顺序是先定义输入、输出、边界和失败成本。

任务定义至少包含:

  • 用户是谁;
  • 输入来自哪里;
  • 允许使用哪些数据;
  • 输出用于建议还是直接执行;
  • 什么算正确;
  • 哪些错误最危险;
  • 延迟和成本上限;
  • 是否需要引用和可解释证据;
  • 哪些步骤必须人工确认;
  • 数据保存和删除要求。
text
示例:技术文档问答

输入:用户问题 + 授权范围内的文档
输出:带段落引用的答案
成功:核心结论被来源支持
失败:无来源时应明确拒答
边界:不能访问用户无权查看的目录
指标:引用正确率、答案正确率、P95、成本
1
2
3
4
5
6
7
8

这样定义后,才能判断需要普通检索、RAG、工具调用、微调还是更强模型。

3. 概率性模型与确定性程序的分工 ​

模型适合处理语言理解、模糊分类、候选生成和开放式推理。 普通程序适合权限、金额、唯一性、事务、数值计算和资源状态转换。

text
用户自然语言
  -> 模型生成候选意图
  -> Schema 校验
  -> 权限与业务规则
  -> 人工确认(高风险)
  -> 确定性执行器
  -> 结果与审计记录
1
2
3
4
5
6
7

模型不能成为数据库约束和授权逻辑的替代品。 即使它通常能判断正确,也无法提供业务需要的强保证。

高副作用动作应满足:

  • 参数经过类型和范围校验;
  • 当前用户具有具体资源权限;
  • 命令包含幂等键;
  • 执行前展示实际影响;
  • 必要时要求人工确认;
  • 执行结果可查询;
  • 重试不会重复产生副作用;
  • 全过程可审计。

4. 数据生命周期 ​

数据工程不只是在训练前清洗一次文件。 它覆盖采集、授权、版本、处理、使用、反馈和删除。

text
Raw Data
  -> consent / license check
  -> cleaning and normalization
  -> versioned dataset
  -> train / eval split
  -> model or index artifact
  -> production feedback
  -> retention and deletion
1
2
3
4
5
6
7
8

训练集与评估集必须隔离。 测试样本泄漏进训练、Prompt 模板或人工调参过程,会让评估结果失真。

数据版本需要记录:

  • 来源和许可证;
  • 采集时间;
  • 清洗规则;
  • 去重方法;
  • 过滤和脱敏;
  • Schema;
  • 分片与哈希;
  • 已知偏差;
  • 删除请求的传播方式。

Embedding 索引也是派生数据。 文档变化、权限变化或 Embedding 模型升级后,需要明确哪些向量失效以及如何重建。

5. 模型生命周期 ​

模型从实验到生产通常经历:

text
候选模型
  -> 离线能力评估
  -> 安全与对抗测试
  -> 性能和成本基准
  -> 小流量灰度
  -> 生产监控
  -> 回滚、替换或退役
1
2
3
4
5
6
7

模型版本不能只记录营销名称。 还要记录具体提供方版本、参数、量化、系统 Prompt、工具 Schema 和推理配置。

温度、Top-p、最大 Token、停止条件和结构化输出模式都会改变系统行为。 这些配置应与代码一起版本化。

模型切换前要比较:

  • 任务正确率;
  • 危险错误率;
  • 格式遵循率;
  • 工具选择准确率;
  • 上下文长度与截断行为;
  • 首 Token 和完整响应延迟;
  • 输入输出 Token 成本;
  • 并发与速率限制;
  • 数据处理与合规条件。

6. 评估是持续工程 ​

单个公开 Benchmark 不能证明产品任务可靠。 评估集需要来自真实任务分布,并覆盖正常、困难和高风险样本。

评估可以分层:

  1. 模型级:问答、分类、推理和格式;
  2. 检索级:召回、排序和引用覆盖;
  3. 工具级:工具选择、参数和结果处理;
  4. Workflow 级:状态、重试、停止和副作用;
  5. 端到端:用户目标、延迟、成本和安全;
  6. 生产级:输入漂移、失败聚类和人工反馈。

自动评分适合规则明确的部分。 开放答案可能需要人工 Rubric 或经过校准的模型评分器。

模型评分器本身也会偏差。 应抽样人工复核,并测量评分一致性和位置偏好。

7. RAG 的边界 ​

RAG 把外部资料检索结果加入模型上下文。 它解决模型权重无法及时包含私有或最新知识的问题,但不会自动保证答案正确。

text
Question
  -> query understanding
  -> retrieval
  -> permission filtering
  -> reranking
  -> context assembly
  -> generation with citations
  -> citation verification
1
2
3
4
5
6
7
8

检索质量需要分别观察召回和排序。 正确文档没有进入候选集时,后续模型无法补救。

权限过滤必须在检索或上下文组装阶段强制执行。 不能先把无权限文本交给模型,再要求模型不要泄露。

引用需要指向真正支持结论的段落。 模型生成一个看似合理的链接,不代表回答忠于来源。

8. Agent 是受控循环 ​

Agent 的最小结构是模型调用、工具执行和循环控制。

text
messages + tools
  -> model response
  -> tool call?
      yes -> validate -> execute -> append result -> loop
      no  -> validate final answer -> stop
1
2
3
4
5

生产循环必须限制:

  • 最大步数;
  • 总时间;
  • Token 和费用;
  • 单工具超时;
  • 并发调用数;
  • 可访问资源;
  • 重试次数;
  • 人工确认点。

多 Agent 只是把不同上下文和工具集合分给多个模型角色。 它会增加协调、延迟、成本和调试难度,不应作为默认方案。

9. 基础设施与编译器 ​

训练基础设施负责把数据和计算分布到 GPU 集群。 关键问题包括并行策略、显存、通信、Checkpoint、调度和故障恢复。

推理基础设施关注批处理、KV Cache、量化、模型路由、并发和尾延迟。 训练吞吐最优的配置不一定适合在线推理。

AI 编译器把计算图和算子映射到具体硬件。 常见阶段包括图优化、算子融合、布局变换、内存规划和代码生成。

text
Framework Graph
  -> normalized IR
  -> graph optimization
  -> operator / kernel lowering
  -> memory and schedule planning
  -> target code
1
2
3
4
5
6

编译优化必须保持数值容差、动态形状和副作用语义。 Kernel 更快也要检查编译时间、显存峰值和端到端收益。

10. 安全与信任边界 ​

Prompt Injection 的本质是外部数据试图影响控制指令。 网页、文档、邮件和工具结果都应被视为不可信输入。

防护不能只依赖一段“忽略恶意指令”的 Prompt。 需要工具最小权限、数据与指令分离、参数校验、输出编码和高风险确认。

密钥不进入 Prompt、日志或模型可见环境。 工具返回只包含完成下一步所需的数据。

沙箱用于限制代码和命令执行的文件、网络、进程、时间和资源。 沙箱逃逸与供应链依赖仍需独立安全治理。

11. 可观测性与成本 ​

一次 AI 请求应能追踪:

  • 输入来源和任务类型;
  • 模型与配置版本;
  • 检索查询和命中文档;
  • 上下文裁剪结果;
  • 工具调用及参数摘要;
  • 重试和错误;
  • 输入输出 Token;
  • 各阶段延迟;
  • 最终状态和用户反馈。

Trace 需要脱敏。 不能为了调试保存用户密钥、完整私有文档或高敏感输入。

成本分析应按成功任务,而不是只按单次模型调用。 错误重试、无效检索和过长上下文都会提高真实成本。

12. 选择最小可行架构 ​

优先级通常是:

  1. 普通确定性程序;
  2. 单次结构化模型调用;
  3. 检索与引用;
  4. 少量受控工具调用;
  5. 明确状态的 Workflow;
  6. 必要时才使用自主循环或多 Agent;
  7. 有数据和收益证据后再微调模型。

架构越复杂,评估与故障面越大。 只有测量证明简单方案无法满足目标时,才引入下一层能力。

课程目录 ​

模块主要内容
LLM 原理与工程神经网络、Transformer、训练、推理、后训练、提示与 API
Agent 工程工具调用、RAG、记忆、工作流、多智能体、安全与可观测性
AI 基础设施数据、分布式训练、GPU 集群、调度、存储、网络与故障恢复
AI 编译器计算图、IR、MLIR、融合、内存规划、调度与代码生成

推荐路线 ​

AI 应用开发:LLM → Agent → 部署与可观测性。

模型与训练工程:LLM → AI Infra → 系统与高性能。

编译器与推理优化:LLM 推理计算 → AI 编译器 → GPU/CPU 体系结构。

工程判断与安全边界 ​

确定性计算、权限校验、金额、资源删除和数据库约束应留在普通程序中。模型可以提出意图或生成候选参数,但高副作用动作需要 Schema 校验、权限检查、幂等键、审计记录和必要的人类确认。RAG 能提供外部资料,却不能自动保证检索结果正确或回答忠于来源;多 Agent 增加角色分工,也会增加延迟、成本和故障面。

选择技术时从最小可行系统开始:能用一次结构化模型调用解决,就不先引入自主循环;能用检索加引用解决,就不急于微调;单机推理满足目标,就不为了架构完整而部署复杂集群。只有测量证明瓶颈存在时,才引入缓存、批处理、量化、并行或专用编译优化。

学完本区后,应能区分模型问题、上下文问题、工具问题和基础设施问题,建立可重复评估,并设计一个即使模型犯错也不会越过关键安全边界的 AI 系统。

最后更新于:

Pager
下一篇LLM 前置知识学习路线 / A Prerequisite Learning Path for Large Language Models

持续记录,持续成长

Copyright © Tidenflow