-
1. NVIDIA CUDA Programming Guide
官方编程指南解释GPU硬件模型、流式多处理器、线程块与SIMT执行。正文据此描述大量线程如何被分组调度,以及分支与资源占用为何会影响有效并行度。指南覆盖多代产品,具体核心组成应回到目标设备的计算能力章节核对,不能把某一代参数当成全部GPU的共同规格。
阅读 CUDA Programming Guide → -
2. NVIDIA GPU Performance Background
该文档用算术强度比较运算需求与内存访问,并给出矩阵、归一化、激活等操作常见的性能限制。正文用它说明同一设备上,大矩阵可能受计算能力限制,而单样本向量或逐元素操作更容易受内存带宽限制。示例数字基于特定GPU,只用于说明分析方法。
阅读 GPU 性能背景指南 → -
3. Google Cloud TPU Architecture
当前官方文档说明TPU芯片中的TensorCore、矩阵乘法单元、向量单元与标量单元,也描述高带宽内存、主机、切片、Pod和芯片间互连。正文据此把TPU解释为矩阵阵列、编译器与集群互连组成的系统。页面会随新代际更新,因此具体矩阵尺寸和拓扑必须按实际版本复核。
阅读 Cloud TPU 架构文档 → -
4. Jouppi 等:In-Datacenter Performance Analysis of a Tensor Processing Unit
2017年 ISCA 论文分析第一代数据中心TPU,讨论矩阵乘法单元、软件管理内存与高百分位响应时间。正文只借它说明早期设计目标与在线推理约束,不把论文中的倍数结果外推到现代GPU、现代TPU或其他NPU。它是一代产品与当时工作负载的原始证据。
阅读 Google Research 论文页 → -
5. OpenXLA:XLA Architecture 与 XLA:GPU
开放编译项目文档说明StableHLO如何经过通用优化、目标相关优化与代码生成,也解释融合如何减少中间张量写回高带宽内存。正文据此把编译器视为架构的一部分。文档描述的是编译管线与目标,不保证任意模型都能获得同等融合效果。
阅读 XLA 架构 → 阅读 XLA:GPU 架构 → -
6. Apple:Analyzing a Core ML model’s performance in Xcode
Apple 开发者文档说明性能报告会显示模型操作在CPU、GPU和Neural Engine上的可用性与实际放置。文档还指出,Core ML 的选择会考虑数据搬运与计算单元启动成本,而不只看原始速度。正文据此说明端侧推理通常是异构执行;报告不测量内存或功耗,仍需额外工具。
阅读 Core ML 性能分析文档 → -
7. MLCommons:MLPerf Inference Submission Guide
官方提交指南把数据中心与边缘系统分开,并为离线、服务器、交互、单流和多流等场景定义不同要求。正文据此说明吞吐与延迟必须放回使用情境。MLPerf结果适合在相同规则、模型、场景与准确率要求下比较,不应把开放组与封闭组或不同场景混成一张总榜。
阅读 MLPerf Inference 提交指南 → -
8. Microsoft:Windows ML Execution Providers
当前 Microsoft Learn 文档说明 Windows ML 可通过执行提供程序在CPU、GPU和NPU上加速推理,并按设备与驱动条件提供不同后端。正文据此说明跨厂商NPU需要运行时和供应商后端协作。支持列表与系统要求会变化,部署时应检查目标Windows版本、驱动与提供程序版本。
阅读 Windows ML 执行提供程序文档 → -
9. Apple Core ML 概览与计算单元配置
Core ML 概览说明框架会利用CPU、GPU与Neural Engine,并强调设备端执行对响应、网络依赖与数据路径的影响。MLComputeUnits 文档列出允许全部单元、仅CPU、CPU加GPU或CPU加神经引擎等配置。它们支持“运行时会组合多种单元”的论述,但不能代表其他厂商NPU的内部结构。
阅读 Core ML 概览 → 阅读 MLComputeUnits →
官方文档 · 原始论文 · 公开规则
来源与延伸阅读
架构机制优先引用芯片厂商与开放编译项目的技术文档;跨系统性能判断则使用公开基准规则,并明确每项证据不能外推到哪里。
- 架构文档解释设计与编程模型,不等于独立性能评测
- 原始论文支持特定代际结论,不替代当前产品测试
- 运行时文档说明调度与兼容性,仍需真机复测
- 基准规则提供可比方法,不预先指定哪类芯片获胜