模块 3 课前
阅读参考材料,回答:
nvidia-smi 显示 memory.free = 10GB,但 cudaMalloc(20GB) 报 OOM。可能的原因是什么?cudaMallocHost (pinned memory) 比 malloc (pageable) 传输快的原因。为什么 PCIe 代际越高,pinned 的优势越大?在有 GPU 的环境中运行 code/01_dma_bandwidth.py,记录结果并绘制 H2D/D2H 带宽对比柱状图。与理论 PCIe 带宽对比,计算效率百分比。
| 维度 | 权重 |
|---|---|
| 理论分析 (4题) | 80% |
| 带宽测试 | 20% (选做) |
vllm-bench/docs/gpu-memory-management.mdvisuals/gpu-memory-visual.html — 6 层交互概念图