本地化Ai大模型Agent部署
419 字
2 分钟
本地化Ai大模型Agent部署
前置条件
- 安装docker
- 安装docker-compose
- 安装cuda
- 设备为Jetson AGX Thor
安装编译依赖
# 安装依赖sudo apt update && sudo apt install -y build-essential git libopenblas-dev拉取 llama.cpp 源码(国内加速克隆)
# 加速克隆源码git clone https://ghproxy.com/https://github.com/ggml-org/llama.cpp.git# 进入项目目录cd llama.cpp编译 llama.cpp
# 编译make clean && CUDA=1 make -j$(nproc)下载模型
- 量化版本选择
- Q4_K_P:显存占用低,适合小显存设备
- Q8_K_P:输出精度更高,显存占用更大
- 多模态模型额外下载配套 mmproj 视觉文件
- HuggingFace 镜像替换规则
原地址:
https://huggingface.co/xxx/模型仓库名加速地址:https://hf-mirror.com/xxx/模型仓库名 - 将下载完成的
.gguf模型放入项目内models/文件夹,统一路径避免读取报错
测试推理(验证编译与模型可用)
# 测试推理./main \ -m models/你的模型.gguf \ #`--flash-attn`:注意力计算加速,降低显存占用 --flash-attn \ # `--mlock`:锁定内存,防止系统交换分区卡顿 --mlock \ # `--np`:并行推理线程数,默认1 -np $(nproc) \ # `--c`:上下文长度,默认8192 -c 8192配置 systemd 常驻后台服务(开机自启、崩溃自动重启)
[Unit]Description=Llama.cpp Local LLM ServiceAfter=network.target
[Service]User=你的用户名WorkingDirectory=/home/你的用户名/llama.cppExecStart=/home/你的用户名/llama.cpp/server -m models/你的模型.gguf --flash-attn --mlock -c 8192Restart=alwaysRestartSec=5
[Install]WantedBy=multi-user.target执行以下命令加载并启动服务:
# 重载系统服务配置sudo systemctl daemon-reload# 设置开机自启sudo systemctl enable llama# 启动llama推理服务sudo systemctl start llama# 实时查看运行日志journalctl -u llama -f部署AstrBot
mkdir astrbot && cd astrbotsudo docker run -itd -p 6185:6185 -p 6199:6199 -v $PWD/data:/AstrBot/data -v /etc/localtime:/etc/localtime:ro -v /etc/timezone:/etc/timezone:ro --name astrbot m.daocloud.io/docker.io/soulter/astrbot:latest文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!
相关文章智能推荐
1
biliup → AstrBot(QQ) 录播完成通知 修复
服务器biliup 录制上传后通过 watch_backup.py 监听备份目录,经 push_lite 推送到 AstrBot QQ 群的通知链路修复记录
2
Rustdesk服务部署
服务器因为工作需要,所以在服务器上部署Rustdesk服务
3
k8s集群部署
服务器2025-08-04
4
我的第二个QQ机器人AstrBot
服务器2025-07-21
5
300l_pro推算卡驱动固件部署
服务器因为工作需要,所以在服务器上部署300l_pro推算卡的驱动和固件
随机文章随机推荐



