2026年10月3日

目录


第一阶段:准备 Mac 环境

我们需要安装一些必要的开发工具来编译代码和下载模型。

1. 安装 Xcode 命令行工具

打开 Mac 的“终端”(Terminal),输入以下命令并回车。如果弹窗提示,点击“安装”:

Bash

xcode-select --install

2. 安装 Homebrew(Mac 的包管理器)

如果你的 Mac 还没安装 Homebrew,请在终端粘贴以下命令运行:

Bash

/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

3. 安装必要的依赖

使用 Homebrew 安装 git(代码管理)、cmake(编译工具)和 wget(下载工具):

Bash

brew install git cmake wget

第二阶段:下载并编译 llama.cpp

llama.cpp 是用 C++ 编写的极致轻量级推理引擎。在 Mac 上,它会自动开启 Metal 加速,直接调用 M4 的 GPU。

1. 克隆项目源码

在终端中依次运行:

Bash

# 进入你的用户主目录
cd ~
# 克隆 llama.cpp 仓库
git clone https://github.com/ggerganov/llama.cpp.git
# 进入文件夹
cd llama.cpp

2. 编译项目 (开启 Metal 显卡加速)

在 llama.cpp 目录下,直接运行以下命令进行编译。对于 Mac,系统默认会激活 Metal 支持:

Bash

make -j

(注:-j 表示使用多核并行编译,速度非常快。编译完成后,你会在目录下看到 llama-cli 和 llama-server 等可执行文件。)


第三阶段:下载 Qwen2.5 7B GGUF 模型

llama.cpp 运行的模型格式为 GGUF。为了兼顾推理速度和回答质量,对于 M4 芯片(基础款 16G 内存),强烈推荐下载 Q4_K_M(4bit 适中量化版)或 Q8_0(8bit 高质量版)。

这里以阿里云官方发布的 Qwen2.5-7B-Instruct-Q4_K_M.gguf 为例(文件大小约 4.3GB,极其轻量):

1. 在 llama.cpp 目录下创建一个存放模型的文件夹:

Bash

mkdir models

2. 使用 wget 直接下载模型到 models 文件夹中:

Bash

wget -O models/qwen2.5-7b-instruct-q4_k_m.gguf https://huggingface.co/Qwen/Qwen2.5-7B-Instruct-GGUF/resolve/main/qwen2.5-7b-instruct-q4_k_m.gguf?download=true

(提示:由于国内访问 Hugging Face 可能网络受限,如果上述命令下载失败,你可以前往国内的 ModelScope(魔搭社区) 搜索 Qwen2.5-7B-Instruct-GGUF 手动下载,然后将文件拖放进 llama.cpp/models/ 文件夹即可。)


第四阶段:满血运行 Qwen2.5!

现在准备工作全部完成,你可以通过两种方式与模型对话。确保你当前终端路径仍在 llama.cpp 文件夹下。

方式一:在终端中直接进行交互(极客风)

运行以下命令启动终端对话:

Bash

./llama-cli -m models/qwen2.5-7b-instruct-q4_k_m.gguf -p "你是一个有用的人工智能助手。" -cnv -c 8192 -ngl 99

核心参数硬核解析(保证你知其然且知其所以然):

  • -m:指定模型文件路径。

  • -p:System Prompt(系统提示词),设定它的角色。

  • -cnv:开启 Conversation 模式,像聊天软件一样你一句我一句。

  • -c 8192:Context Window(上下文窗口),设为 8192 Token,足够处理几万字的长篇对话或文章分析。

  • -ngl 99:【极其重要】 Number of GPU Layers。设为 99 意味着强行把模型的所有层都塞进你的 M4 GPU 显存里,实现 100% 硬件加速。此时你会体验到极度丝滑的输出速度(通常能达到每秒 40-60 个 Token)。

方式二:启动 Web 服务(推荐,可在浏览器中使用)

如果你觉得终端太黑白了,llama.cpp 自带了一个非常轻量好用的 Web 界面:

Bash

./llama-server -m models/qwen2.5-7b-instruct-q4_k_m.gguf -c 8192 -ngl 99 --port 8080

运行后,终端会显示服务器已启动。此时:

  1. 打开你 Mac 上的浏览器(Safari 或 Chrome)。

  2. 在地址栏输入:http://127.0.0.1:8080

  3. 你会看到一个极简风格的聊天界面,直接在下面的输入框打字就可以开始和 Qwen2.5 聊天了!


故障排查与小贴士 (Tips)

  • 确认 GPU 是否在工作: 在运行模型时,往上翻一下终端的启动日志,如果看到类似 ggml_metal_init: allocating 和 llama_kv_cache_init: VRAM 的字样,说明成功调用了 M4 芯片的 GPU。

  • 清理内存: 虽然 7B 模型只需 4.5G 左右的统一内存,但如果你开了太多其他软件导致变卡,可以关掉服务器,清理一下后台再重新运行。

About The Author

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注