AI应用运行时分层架构
最近更新:2026-08-07
|
字数总计:610
|
阅读估时:2分钟
|
阅读量:次
- 分层架构
- 每层职责
分层架构
该图聚焦的是:某一个推理请求,比如 ‘python是什么’,从应用层到硬件的运行链路
- 模型相关:Layer0 - Layer5
- Harness相关:Layer6 - Layer7
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64
| ┌─────────────────────────────────────────────────┐ │ Layer 8: 用户应用层 │ │ ChatGPT、Copilot、AI 客服、代码助手、AI 搜索 │ └──────────────────────┬──────────────────────────┘ │ ┌──────────────────────▼──────────────────────────┐ │ Layer 7: Agent / 编排层 │ │ LangGraph、CrewAI、AutoGen、Dify、Coze │ │ → 多步流程、工具调用、人机协作、状态管理 │ └──────────────────────┬──────────────────────────┘ │ ┌──────────────────────▼──────────────────────────┐ │ Layer 6: 应用框架层 │ │ LangChain、LlamaIndex、Prompt 工程、RAG Pipeline │ │ → 向量检索、文档解析、上下文组装 │ └──────────────────────┬──────────────────────────┘ │ ┌──────────────────────▼──────────────────────────┐ │ Layer 5b: 算法专属优化层 │ │ Transformer: PagedAttention、Prefix Caching、 │ │ Speculative Decoding │ │ Diffusion: Denoising Pipeline 调度 │ │ → 跟具体算法架构深度绑定 │ └──────────────────────┬──────────────────────────┘ │ ┌──────────────────────▼──────────────────────────┐ │ Layer 5a: 通用 Serving 基础设施 │ │ HTTP 服务、请求排队、批处理调度 │ │ 流式输出、负载均衡、扩缩容 │ │ → 跟具体算法无关 │ └──────────────────────┬──────────────────────────┘ │ ┌──────────────────────▼──────────────────────────┐ │ Layer 4: 模型框架层 │ │ PyTorch、TensorFlow、JAX │ │ → 平台无关的张量运算、自动求导、模型定义 │ └──────────────────────┬──────────────────────────┘ │ ┌──────────────────────▼──────────────────────────┐ │ Layer 3: 编译优化层 │ │ TorchInductor、XLA、MLIR、Triton(OpenAI) │ │ → 图优化、算子融合、Kernel 自动生成 │ │ → 这里是分叉点:不同硬件走不同编译路径 │ └──────────────────────┬──────────────────────────┘ │ ┌──────────────────────▼──────────────────────────┐ │ Layer 2: GPU 计算平台层 │ │ CUDA Runtime、cuDNN、cuBLAS、NCCL │ │ (国产:CANN、BANG、MUSA) │ │ → 具体平台的编程模型、内存管理、通信原语 │ └──────────────────────┬──────────────────────────┘ │ ┌──────────────────────▼──────────────────────────┐ │ Layer 1: 驱动与硬件抽象层 │ │ NVIDIA 驱动、AMD ROCm 驱动 │ │ → 设备管理、显存分配、任务调度 │ └──────────────────────┬──────────────────────────┘ │ ┌──────────────────────▼──────────────────────────┐ │ Layer 0: 硬件层 │ │ NVIDIA GPU(H100/B200)、AMD GPU、国产卡 │ │ (昇腾、寒武纪、海光、摩尔线程、壁仞) │ │ + RDMA 网络 + NVMe 存储 │ └─────────────────────────────────────────────────┘
|
每层职责
| 层 |
职责 |
一句话 |
| L8 应用 |
面向用户的产品 |
用户直接感知的东西 |
| L7 Agent/编排 |
流程编排与调度 |
管”先做什么、后做什么、出错怎么办” |
| L6 应用框架 |
模型与数据的胶水 |
管”怎么把数据喂给模型、怎么组装上下文” |
| L5b 算法专属优化 |
针对具体算法的服务优化 |
Transformer 的 PagedAttention、Speculative Decoding 等 |
| L5a 通用 Serving |
模型上线的通用基础设施 |
请求排队、批处理、流式输出、扩缩容 |
| L4 模型框架 |
平台无关的模型定义与计算 |
管”怎么定义模型、怎么算梯度” |
| L3 编译优化 |
代码翻译与优化 |
管”怎么把框架代码变成高效 GPU 指令”(分叉点) |
| L2 GPU 计算平台 |
具体平台的编程抽象 |
管”怎么让代码在 GPU 上跑起来” |
| L1 驱动 |
硬件控制 |
管”怎么直接操作 GPU 硬件” |
| L0 硬件 |
物理计算单元 |
实际的晶体管 |
2026-08-04
该篇文章被 xingrui
归为分类:
AI