标签: 云原生
使用该标签的全部文章 "云原生".
零基础看懂 ai infra:从一张 gpu 到大模型服务
沿着大模型训练和推理的真实工作流程,理解 gpu、nvlink、infiniband、nccl、模型并行、kubernetes 调度、存储与推理优化等常见概念。
llm 推理服务为什么需要多级缓存、pd 分离和连续批处理
从实际工程场景出发,理解多级缓存、pd 分离和连续批处理如何减少重复计算、提高 gpu 利用率,并降低大模型推理成本。
k8s多租户学习
为每个租户创建独立namespace,并创建相应的resourcequota和limitrange限制资源使用。
docker部署llm
gpu驱动版本需要更新,否则vllm不支持 参数需要调整,否则gpu oom 大模型通过国内镜像下载 vllm通过国内镜像下载