本地化Ai大模型Agent部署

419 字
2 分钟
本地化Ai大模型Agent部署

前置条件#

  1. 安装docker
  2. 安装docker-compose
  3. 安装cuda
  4. 设备为Jetson AGX Thor

安装编译依赖#

Terminal window
# 安装依赖
sudo apt update && sudo apt install -y build-essential git libopenblas-dev

拉取 llama.cpp 源码(国内加速克隆)#

Terminal window
# 加速克隆源码
git clone https://ghproxy.com/https://github.com/ggml-org/llama.cpp.git
# 进入项目目录
cd llama.cpp

编译 llama.cpp#

Terminal window
# 编译
make clean && CUDA=1 make -j$(nproc)

下载模型#

  1. 量化版本选择
    • Q4_K_P:显存占用低,适合小显存设备
    • Q8_K_P:输出精度更高,显存占用更大
    • 多模态模型额外下载配套 mmproj 视觉文件
  2. HuggingFace 镜像替换规则 原地址:https://huggingface.co/xxx/模型仓库名 加速地址:https://hf-mirror.com/xxx/模型仓库名
  3. 将下载完成的 .gguf 模型放入项目内 models/ 文件夹,统一路径避免读取报错

测试推理(验证编译与模型可用)#

Terminal window
# 测试推理
./main \
-m models/你的模型.gguf \
#`--flash-attn`:注意力计算加速,降低显存占用
--flash-attn \
# `--mlock`:锁定内存,防止系统交换分区卡顿
--mlock \
# `--np`:并行推理线程数,默认1
-np $(nproc) \
# `--c`:上下文长度,默认8192
-c 8192

配置 systemd 常驻后台服务(开机自启、崩溃自动重启)#

[Unit]
Description=Llama.cpp Local LLM Service
After=network.target
[Service]
User=你的用户名
WorkingDirectory=/home/你的用户名/llama.cpp
ExecStart=/home/你的用户名/llama.cpp/server -m models/你的模型.gguf --flash-attn --mlock -c 8192
Restart=always
RestartSec=5
[Install]
WantedBy=multi-user.target

执行以下命令加载并启动服务:#

Terminal window
# 重载系统服务配置
sudo systemctl daemon-reload
# 设置开机自启
sudo systemctl enable llama
# 启动llama推理服务
sudo systemctl start llama
# 实时查看运行日志
journalctl -u llama -f

部署AstrBot#

Terminal window
mkdir astrbot && cd astrbot
sudo docker run -itd -p 6185:6185 -p 6199:6199 -v $PWD/data:/AstrBot/data -v /etc/localtime:/etc/localtime:ro -v /etc/timezone:/etc/timezone:ro --name astrbot m.daocloud.io/docker.io/soulter/astrbot:latest

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

本地化Ai大模型Agent部署
https://vtdd.vip/posts/本地化ai大模型agent/
作者
Zero
发布于
2026-03-12
许可协议
CC BY-NC-SA 4.0

评论区

Profile Image of the Author
Zero
有三件事人类都要经历:出生、生活和死亡。他们出生时无知无觉,死到临头,痛不欲生,活着的时候却又怠慢了人生。——拉布吕耶尔
分类
标签
最新动态
站点统计
文章
25
动态
1
分类
7
标签
27
总字数
11,266
运行时长
0
最后活动
0 天前
站点信息
构建平台
Local
博客版本
Firefly v6.14.3
文章许可
CC BY-NC-SA 4.0