多喝热水
发布于 今天 13:43
字节跳动一面(AI Infra)0914面经
本篇目录(7 节)
岗位方向:后端工程师(AI Infra)
形式:单面 1 位面试官,线上,约 25 分钟后进入笔试(笔试约 30 分钟)
环节顺序:自我介绍 → 大模型基础与实操 → Agent / MCP / Skill 理解 → GPU 硬件指标 → 互联与通信 → MPI 分布式 → 在线服务工程 → Profiling 与算子实战 → 笔试
#大模型基础
- 你接触过、实际实操过大模型的推理或者训练吗?
- GPU 上怎么做实时推理或训练任务?
- 对大模型的应用场景了解吗?
#Agent / MCP / Skill(我恍惚了一下我面的是不是 agent 岗)
- 项目拷打
- 你对 Agent 有理解吗?为什么现在会有 Agent 这个概念?为什么 MCP 或者之前的 Skill 没法满足复杂业务需求,需要 Agent 这套东西?
- tools 在 MCP 这一代、Skill 这一代就已经实现了。那为什么还需要 Agent?Agent 相比 Skill 带来了哪些提升?
- Skill 和 Agent 比较有代表性的开源项目有哪些?
- OpenClaw 相比 Claude Code 这种 Skill,区别在哪?为什么 Claude 能引领 Agent 流行起来,他们做对了什么?为什么 Agent 能取代"Claude Code + Skill"的方式进入 workflow?
面试官最后大概讲了讲,感觉我在被讲课
#GPU 硬件性能指标
- 你对表征 GPU 性能的一些关键指标有没有了解?
- 除了这些硬件 spec 之外,还有哪些比较关键?比如部署 2.6T 级别的大模型需要多张卡或多台机器,这种情况下还有哪些 spec 需要关心?
- CPU 和 GPU 之间的通信有没有可能也会有瓶颈?
- CPU 跟 CPU 之间怎么通信的?PCIe 你知道吗?
- 你了解过 NVSwitch 或者 *nfiniBand / RDMA 吗?
- NCCL 你了解吗?
依旧讲课
#MPI / 分布式通信
- 你这里提到 MPI 分布式通信,有没有遇到过一些问题?会出现网络瓶颈之类的吗?
- 如果做 reduce 速度上不来,整个系统吞吐到瓶颈,发现是 MPI 通信时间过长,你该怎么定位它的问题?
- MPI 本身通信到底怎么做的?底层有共享内存的方案也有网络的方案,通信慢大概率是哪里导致的?有没有可能是带宽上限或者慢节点、慢链路?
#在线服务的工程能力
- 你有个 Agent 服务,有没有考虑过给它做常见在线服务的功能:配置热更新、日志缓存、灰度、回滚?
- 你是在线服务,有没有考虑过做灰度,或者做冗余、容灾之类的能力?
#Profiling 与算子实战
- Profiling 这一块你做的多吗?主要定位哪些问题?
- 有没有定位到过一些问题?有没有实际解决过的东西?
#手撕
带过期处理的LRU KVCache
原文:https://www.nowcoder.com/feed/main/detail/a1ce24c561874141abe6ba18a466f982
1 次浏览

客服微信
全部评论