字节跳动

面经合集 · 0 道真题

查看该公司全部面经

多喝热水

发布于 今天 13:36

AI Infra / 大模型部署校招一面面经

进行中
轮次一面
0 道真题·约 2 分钟读完
  1. ONNX转RKNN的过程中,通常会做哪些图优化?请列举至少三种。
  2. 如何判断一个算子是带宽瓶颈还是计算瓶颈?Roofline模型是什么?算术强度怎么算?
  3. CUDA Graph适合什么场景?动态输入下怎么用CUDA Graph?
  4. Transformer推理中,KV Cache的显存占用怎么估算?batch size从1增加到32,显存怎么变化?
  5. FlashAttention的原理是什么?它为什么能减少HBM访问?
  6. vLLM的PagedAttention是怎么实现的?和传统KV Cache管理方式有什么区别?
  7. GPU的SIMT架构有什么特点?遇到分支发散时会发生什么?
  8. CUDA编程中,一个Kernel在Launch时CPU都做了些什么?
  9. 你在做算子优化时,用什么调优工具?如果发生Stall,主要有哪几种Stall类型?
  10. 长序列训练中,显存占用主要来自哪些部分?怎么估算?
  11. DeepSpeed的ZeRO三个阶段分别是什么?ZeRO-2和ZeRO-3的区别是什么?
  12. 梯度检查点是什么技术?它解决了什么问题?代价是什么?
  13. CPU的五级流水线是哪五级?三种冒险分别是什么?
  14. Cache的物理结构是什么?如果发生Cache Miss,数据从内存加载到Cache的完整流程是什么?
  15. SIMD和SIMT结构的核心区别是什么?各适合什么类型的计算?
  16. C++的编译流程是什么?链接这一步做了什么?undefined symbol可能的原因有哪些?
  17. 虚函数的底层实现原理是什么?虚函数表存在哪里?
  18. inline函数的实现原理是什么?和宏有什么区别?
  19. 如果要在NPU上部署一个PyTorch模型,你知道哪些流程和工具链?
  20. 手撕:实现一个函数,计算两个矩阵的乘法。给定矩阵A(m×n)和矩阵B(n×p),返回结果矩阵C(m×p)。

原文:https://www.nowcoder.com/discuss/929137039063121920

1 次浏览

全部评论

快捷回复
0/500

面试稳了,简历也得过硬

专业模板 + AI 润色,拒绝花里胡哨,快速产出一份能过筛的简历!

CopyRight © 2023 CodeCV简历 | 赣ICP备2023009154号