标签: 学习笔记
使用该标签的全部文章 "学习笔记".
零基础看懂 ai infra:从一张 gpu 到大模型服务
沿着大模型训练和推理的真实工作流程,理解 gpu、nvlink、infiniband、nccl、模型并行、kubernetes 调度、存储与推理优化等常见概念。
零基础看懂 slurm:从多节点集群到第一个作业
用一个控制节点和两个计算节点的例子,介绍 slurm 的使用场景、核心组件、安装思路、常用命令和多节点作业。
llm 推理服务为什么需要多级缓存、pd 分离和连续批处理
从实际工程场景出发,理解多级缓存、pd 分离和连续批处理如何减少重复计算、提高 gpu 利用率,并降低大模型推理成本。
从评论标注到在线预测:小林的 ai 评论分类项目
这是一篇写给初学者的 ai 业务流程科普。文章不讨论具体系统和基础设施,只用一个完整故事解释:什么是标注、开发、训练、评估、推理和上线。