你好,我是 LEo
RSS Feed这里记录软件开发、云原生、ai 工程实践,以及工作与阅读中的长期思考。
最近文章
提高 chatgpt 和 codex 工作效率:把经验变成可复用的工作流
结合本周实际使用记录,我最值得优先改进的三件事是:先写 runbook 和验收标准,再进入环境;用验收矩阵控制 api 测试范围;用交接卡连接 chatgpt 与 codex。
零基础看懂 ai infra:从一张 gpu 到大模型服务
沿着大模型训练和推理的真实工作流程,理解 gpu、nvlink、infiniband、nccl、模型并行、kubernetes 调度、存储与推理优化等常见概念。
零基础看懂 slurm:从多节点集群到第一个作业
用一个控制节点和两个计算节点的例子,介绍 slurm 的使用场景、核心组件、安装思路、常用命令和多节点作业。
llm 推理服务为什么需要多级缓存、pd 分离和连续批处理
从实际工程场景出发,理解多级缓存、pd 分离和连续批处理如何减少重复计算、提高 gpu 利用率,并降低大模型推理成本。