你好,我是 LEo
RSS Feed这里记录软件开发、云原生、ai 工程实践,以及工作与阅读中的长期思考。
最近文章
零基础看懂 ai infra:从一张 gpu 到大模型服务
沿着大模型训练和推理的真实工作流程,理解 gpu、nvlink、infiniband、nccl、模型并行、kubernetes 调度、存储与推理优化等常见概念。
零基础看懂 slurm:从多节点集群到第一个作业
用一个控制节点和两个计算节点的例子,介绍 slurm 的使用场景、核心组件、安装思路、常用命令和多节点作业。
llm 推理服务为什么需要多级缓存、pd 分离和连续批处理
从实际工程场景出发,理解多级缓存、pd 分离和连续批处理如何减少重复计算、提高 gpu 利用率,并降低大模型推理成本。
chatgpt小贴士(十)
分享三个 chatgpt 使用小技巧:将调试过程整理成 runbook、用环境清单简化登录和检查,以及用 goal mode 按明确的验收标准推进任务。