AI大模型运维
大模型:基于海量数据预训练、采用深度学习架构(主要是 Transformer),具备通用理解、生成、推理能力的人工智能模型,就是一个 “超级大脑”;它通过海量的文字、知识、对话、代码训练,学会了人类的语言和逻辑,你跟它说话、提要求,它能听懂、思考、回答、创作和写代码;
GPU(算力引擎):拥有数千个计算核心,专门处理海量重复的并行计算(如矩阵乘法、浮点运算),是 “超级计算器”;CPU 是全能学霸,擅长复杂逻辑,一次只专心做一件事,GPU 是流水线工人,擅长简单重复,一次同时做一万件事;
大模型token:大语言模型(LLM)处理文本时的基本单位,模型读取和生成文本时,会先把文本切分成一段一段的小块,这些小块就是 token
大模型训练:用海量数据 + 超大算力集群,对神经网络参数进行持续优化,使模型具备语言理解与生成能力的过程
IB网络:
大模型应用: 指的是把大语言模型能力落地到具体业务场景中,让模型从“会聊天”变成“能解决实际问题的系统能力”。
显卡型号:4090T、A100、A10、A30、V100、P100
一、购买GPU服务器和驱动安装
1、购买服务器
- 硬件类型(ecs.gn7i-c8g1.2xlarge)
- 操作系统镜像选择
- 公网IP和安全组
- 登录秘钥创建和选择,最后点击下单
2、显卡驱动安装
2.1 禁用默认自带驱动
- nouveau driver(Nouveau 驱动) 是 Linux 系统自带的开源 NVIDIA 显卡驱动,由社区开发,不是 NVIDIA 官方驱动
#查看系统是否安装了默认的自带显卡驱动,如果有返回就要禁止并重新生成initramfs,如果没有返回就忽略,购买物理服务器一般都自带了开源的显卡驱动,阿里云服务器没有安装系统自带显卡驱动
initramfs = Linux 开机时加载的临时小系统,用来启动真实系统
[root@iZ0jlb4f7jgkiyowxgrqyjZ bin]# lsmod | grep nouveau注意事项:
- 修改配置前先备份原文件,尤其是 SSH、Nginx、数据库和 Kubernetes 生产配置。
#在 /usr/lib/modprobe.d/dist-blacklist.conf 中添加两行内容,禁止默认驱动
[root@iZ0jlb4f7jgkiyowxgrqyjZ bin]# vim /usr/lib/modprobe.d/dist-blacklist.conf
blacklist nouveau
options nouveau modeset=0注意事项:
- 修改配置前先备份原文件,尤其是 SSH、Nginx、数据库和 Kubernetes 生产配置。
# 接着给当前镜像做备份
[root@iZ0jlb4f7jgkiyowxgrqyjZ bin]# mv /boot/initramfs-$(uname -r).img /boot/initramfs-$(uname -r).img.bak
# 建立新的镜像
[root@iZ0jlb4f7jgkiyowxgrqyjZ bin]# dracut /boot/initramfs-$(uname -r).img $(uname -r)
# 重新启动服务器
[root@iZ0jlb4f7jgkiyowxgrqyjZ bin]# shutdown -r now注意事项:
- 修改配置前先备份原文件,尤其是 SSH、Nginx、数据库和 Kubernetes 生产配置。
2.2 查看显卡型号
[root@iZ0jl2l915eib2pdtungqxZ ~]# lspci | grep -i nvidia
00:07.0 3D controller: NVIDIA Corporation GA102GL [A10] (rev a1)
#[A10] 显卡硬件型号注意事项:
- 修改配置前先备份原文件,尤其是 SSH、Nginx、数据库和 Kubernetes 生产配置。
2.3 下载和安装显卡驱动
- 英伟达显卡官方驱动下载地址:https://developer.nvidia.com/cuda-downloads,阿里云操作系统Alibaba Cloud Linux release 3 (OpenAnolis Edition)是Rocky衍生版,所以选择Rocky即可
- NVIDIA GPU 驱动(NVIDIA Driver) 是让操作系统能够识别、管理并正常使用 NVIDIA 显卡的 基础软件
- CUDA 是 NVIDIA 推出的 GPU 通用计算平台和编程模型,让 GPU 不只跑图形,还能跑各种计算任务(AI、深度学习、高性能计算等,允许你用 C/C++、Python、Rust、Java 等语言调用 GPU 执行代码
#下载驱动
[root@iZ0jlb4f7jgkiyowxgrqyjZ ~]# wget https://developer.download.nvidia.com/compute/cuda/13.1.1/local_installers/cuda_13.1.1_590.48.01_linux.run
驱动安装
[root@iZ0jlb4f7jgkiyowxgrqyjZ ~]# sh cuda_13.1.1_590.48.01_linux.run注意事项:
- 修改配置前先备份原文件,尤其是 SSH、Nginx、数据库和 Kubernetes 生产配置。
# 添加CUDA环境变量
[root@iZ0jlb4f7jgkiyowxgrqyjZ ~]# echo 'export PATH=/usr/local/cuda/bin:$PATH' >> ~/.bashrc
[root@iZ0jlb4f7jgkiyowxgrqyjZ ~]# echo 'export LD_LIBRARY_PATH=/usr/local/cuda/lib64:$LD_LIBRARY_PATH' >> ~/.bashrc
[root@iZ0jlb4f7jgkiyowxgrqyjZ ~]# source ~/.bashrc命令作用:
- 把命令后的文本或变量展开结果写到标准输出;配合
>或>>时会改为写入文件,前者覆盖、后者追加。
执行结果:
- 成功后文本或变量展开结果会输出到终端;带重定向时会写入目标文件。
关键参数:
注意事项:
**注意事项:**注意事项:
**关键参数:**
**注意事项:**
参考文档:https://github.com/NVIDIA/k8s-device-plugin?tab=readme-ov-file#enabling-gpu-support-in-kubernetes
命令拆解:
| 命令部分 | 重要程度 | 详细解释 |
|---|---|---|
-f | 必看 | 指定要读取或操作的 YAML 文件。 |
https://raw.githubusercontent.com/NVIDIA/k8s-device-plugin/v0.17.1/deployments/static/nvidia-device-plugin.yml | 普通 | 配置文件路径,命令会读取这个文件里的配置。 |
-n | 普通 | 指定 Kubernetes 命名空间 kube-system,命令只在该命名空间内查找或修改资源。 |
注意事项:
--docker-email=your-email@example.com
**命令拆解:**
| 命令部分 | 重要程度 | 详细解释 |
|---|---|---|
| `--docker-server=crpi-u2hnpi6tp166p9nj.cn-beijing.personal.cr.aliyuncs.com` | 【普通】 | 长参数 `--docker-server` 的值是 `crpi-u2hnpi6tp166p9nj.cn-beijing.personal.cr.aliyuncs.com`,用于精确控制命令行为。 |
| `--docker-username=administ_lan` | 【普通】 | 长参数 `--docker-username` 的值是 `administ_lan`,用于精确控制命令行为。 |
| `--docker-password=Lan12345678` | 【普通】 | 长参数 `--docker-password` 的值是 `Lan12345678`,用于精确控制命令行为。 |
| `--docker-email=your-email@example.com` | 【普通】 | 长参数 `--docker-email` 的值是 `your-email@example.com`,用于精确控制命令行为。 |
**注意事项:**
metadata:
spec:
selector:
matchLabels:
template:
metadata:
labels:
spec:
containers:
resources:
limits:
securityContext:
ports:
imagePullSecrets:
---
metadata:
spec:
selector:
ports:注意事项:
metadata: spec: selector: matchLabels: template: metadata: labels: spec: containers: env: ports: imagePullSecrets:
--- metadata: spec: selector: ports:
**注意事项:**
命令拆解:
| 命令部分 | 重要程度 | 详细解释 |
|---|---|---|
-f | 必看 | 指定要读取或操作的 YAML 文件。 |
https://raw.githubusercontent.com/NVIDIA/dcgm-exporter/master/dcgm-exporter.yaml | 普通 | 配置文件路径,命令会读取这个文件里的配置。 |
注意事项:
metadata: labels: spec: selector: matchLabels: namespaceSelector: matchNames: endpoints:
**注意事项:**
本文由飞书云文档同步生成。涉及命令、SQL、配置示例时,请以飞书源文档和实际环境执行结果为准。