官方文档 · 原始论文 · 公开规则

来源与延伸阅读

架构机制优先引用芯片厂商与开放编译项目的技术文档;跨系统性能判断则使用公开基准规则,并明确每项证据不能外推到哪里。

  1. 1. NVIDIA CUDA Programming Guide

    官方编程指南解释GPU硬件模型、流式多处理器、线程块与SIMT执行。正文据此描述大量线程如何被分组调度,以及分支与资源占用为何会影响有效并行度。指南覆盖多代产品,具体核心组成应回到目标设备的计算能力章节核对,不能把某一代参数当成全部GPU的共同规格。

    阅读 CUDA Programming Guide →
  2. 2. NVIDIA GPU Performance Background

    该文档用算术强度比较运算需求与内存访问,并给出矩阵、归一化、激活等操作常见的性能限制。正文用它说明同一设备上,大矩阵可能受计算能力限制,而单样本向量或逐元素操作更容易受内存带宽限制。示例数字基于特定GPU,只用于说明分析方法。

    阅读 GPU 性能背景指南 →
  3. 3. Google Cloud TPU Architecture

    当前官方文档说明TPU芯片中的TensorCore、矩阵乘法单元、向量单元与标量单元,也描述高带宽内存、主机、切片、Pod和芯片间互连。正文据此把TPU解释为矩阵阵列、编译器与集群互连组成的系统。页面会随新代际更新,因此具体矩阵尺寸和拓扑必须按实际版本复核。

    阅读 Cloud TPU 架构文档 →
  4. 4. Jouppi 等:In-Datacenter Performance Analysis of a Tensor Processing Unit

    2017年 ISCA 论文分析第一代数据中心TPU,讨论矩阵乘法单元、软件管理内存与高百分位响应时间。正文只借它说明早期设计目标与在线推理约束,不把论文中的倍数结果外推到现代GPU、现代TPU或其他NPU。它是一代产品与当时工作负载的原始证据。

    阅读 Google Research 论文页 →
  5. 5. OpenXLA:XLA Architecture 与 XLA:GPU

    开放编译项目文档说明StableHLO如何经过通用优化、目标相关优化与代码生成,也解释融合如何减少中间张量写回高带宽内存。正文据此把编译器视为架构的一部分。文档描述的是编译管线与目标,不保证任意模型都能获得同等融合效果。

    阅读 XLA 架构 → 阅读 XLA:GPU 架构 →
  6. 6. Apple:Analyzing a Core ML model’s performance in Xcode

    Apple 开发者文档说明性能报告会显示模型操作在CPU、GPU和Neural Engine上的可用性与实际放置。文档还指出,Core ML 的选择会考虑数据搬运与计算单元启动成本,而不只看原始速度。正文据此说明端侧推理通常是异构执行;报告不测量内存或功耗,仍需额外工具。

    阅读 Core ML 性能分析文档 →
  7. 7. MLCommons:MLPerf Inference Submission Guide

    官方提交指南把数据中心与边缘系统分开,并为离线、服务器、交互、单流和多流等场景定义不同要求。正文据此说明吞吐与延迟必须放回使用情境。MLPerf结果适合在相同规则、模型、场景与准确率要求下比较,不应把开放组与封闭组或不同场景混成一张总榜。

    阅读 MLPerf Inference 提交指南 →
  8. 8. Microsoft:Windows ML Execution Providers

    当前 Microsoft Learn 文档说明 Windows ML 可通过执行提供程序在CPU、GPU和NPU上加速推理,并按设备与驱动条件提供不同后端。正文据此说明跨厂商NPU需要运行时和供应商后端协作。支持列表与系统要求会变化,部署时应检查目标Windows版本、驱动与提供程序版本。

    阅读 Windows ML 执行提供程序文档 →
  9. 9. Apple Core ML 概览与计算单元配置

    Core ML 概览说明框架会利用CPU、GPU与Neural Engine,并强调设备端执行对响应、网络依赖与数据路径的影响。MLComputeUnits 文档列出允许全部单元、仅CPU、CPU加GPU或CPU加神经引擎等配置。它们支持“运行时会组合多种单元”的论述,但不能代表其他厂商NPU的内部结构。

    阅读 Core ML 概览 → 阅读 MLComputeUnits →