多喝热水
发布于 今天 13:36
AI Infra / 大模型部署校招一面面经
- ONNX转RKNN的过程中,通常会做哪些图优化?请列举至少三种。
- 如何判断一个算子是带宽瓶颈还是计算瓶颈?Roofline模型是什么?算术强度怎么算?
- CUDA Graph适合什么场景?动态输入下怎么用CUDA Graph?
- Transformer推理中,KV Cache的显存占用怎么估算?batch size从1增加到32,显存怎么变化?
- FlashAttention的原理是什么?它为什么能减少HBM访问?
- vLLM的PagedAttention是怎么实现的?和传统KV Cache管理方式有什么区别?
- GPU的SIMT架构有什么特点?遇到分支发散时会发生什么?
- CUDA编程中,一个Kernel在Launch时CPU都做了些什么?
- 你在做算子优化时,用什么调优工具?如果发生Stall,主要有哪几种Stall类型?
- 长序列训练中,显存占用主要来自哪些部分?怎么估算?
- DeepSpeed的ZeRO三个阶段分别是什么?ZeRO-2和ZeRO-3的区别是什么?
- 梯度检查点是什么技术?它解决了什么问题?代价是什么?
- CPU的五级流水线是哪五级?三种冒险分别是什么?
- Cache的物理结构是什么?如果发生Cache Miss,数据从内存加载到Cache的完整流程是什么?
- SIMD和SIMT结构的核心区别是什么?各适合什么类型的计算?
- C++的编译流程是什么?链接这一步做了什么?undefined symbol可能的原因有哪些?
- 虚函数的底层实现原理是什么?虚函数表存在哪里?
- inline函数的实现原理是什么?和宏有什么区别?
- 如果要在NPU上部署一个PyTorch模型,你知道哪些流程和工具链?
- 手撕:实现一个函数,计算两个矩阵的乘法。给定矩阵A(m×n)和矩阵B(n×p),返回结果矩阵C(m×p)。
1 次浏览

客服微信
全部评论