2026年10月3日
ChatGPT Image 2026年4月21日 17_18_50

目录


第一步:基础环境与依赖打底

在开始编译之前,需要确保系统具备完整的 C++ 编译链和极速下载工具。打开终端,依次执行:

Bash

# 1. 安装 macOS 必备的 Xcode 命令行工具
xcode-select --install

# 2. 使用 Homebrew 安装 CMake 编译工具
brew install cmake

# 3. 安装 HuggingFace 官方 CLI,并注入 Rust 多线程加速模块
pip install -U huggingface-hub[hf-transfer]

第二步:编译 Metal 硬件加速版 llama.cpp

为了让模型直接调用底层 GPU 算力,必须从源码重新构建 llama.cpp。

Bash

# 1. 克隆官方最新仓库
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp

# 2. 使用 CMake 配置构建环境 (系统会自动侦测并开启 GGML_METAL=ON)
cmake -B build

# 3. 启动多核并行编译 (速度极快)
cmake --build build --config Release -j

执行完毕后,核心的推理引擎可执行文件会生成在 ./build/bin/llama-server。

第三步:极速拉取 Q4 核心模型

Q4_K_M 是“速度与智商”的绝佳甜点位,体积约为 22GB。我们将开启底层加速通道来下载它。

在 llama.cpp 目录下执行:

Bash

# 1. 激活 Rust 多线程狂暴下载模式
export HF_HUB_ENABLE_HF_TRANSFER=1

# 2. 精准拉取模型文件至 models 文件夹
huggingface-cli download unsloth/Qwen3.6-35B-A3B-GGUF \
  Qwen3.6-35B-A3B-UD-Q4_K_M.gguf \
  --local-dir ./models \
  --local-dir-use-symlinks False

第四步:编写 64K 满血点火脚本

为了避免每次启动都输入长串参数,我们需要编写一个专属的启动脚本。这里的参数经过了极端的防死锁与吞吐量调优,确保在 64K 上下文下依然能保持 ~50 t/s 的丝滑输出。

直接复制并执行以下命令:

Bash

cat << 'EOF' > start_qwen36_agent.sh
#!/bin/bash

echo "🚀 正在唤醒 Qwen3.6-35B-A3B (Q4 甜点版 | 64K 满血架构 | Agent 专供)..."
./build/bin/llama-server \
  -m ./models/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf \
  -ngl 99 \
  -c 65536 \
  -fa on \
  -b 2048 \
  -t 16 \
  --port 8080 \
  --host 127.0.0.1 \
  --temp 0.6 \
  --top-p 0.95 \
  --top-k 20 \
  --min-p 0.05
EOF

# 赋予执行权限
chmod +x start_qwen36_agent.sh

(⚠️ 避坑提醒:坚决不要添加 --cache-type-k q8_0 等压缩参数,原生的 FP16 缓存能最大化利用极高的内存带宽;也不要添加 --parallel 2,单并发才能保证 64K 上下文不爆内存。)

第五步:点火与无缝接管工作流

1. 启动后端推理服务器:

Bash

./start_qwen36_agent.sh

等待终端打印出 HTTP server listening on 127.0.0.1:8080,此时 35B 的大脑已经完全载入内存。

About The Author

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注