模型配置手册
AGI 通过 llama.cpp 在设备端运行大语言模型。本手册介绍模型下载与导入、量化与性能设置、多模型管理与切换策略,以及对话参数调节,帮助你按需配置本地模型。
01模型下载与导入
本地模型通常以 GGUF 格式发布,该格式被 llama.cpp 原生支持。请根据设备能力选择合适的模型与量化等级。
- 选择模型从可信来源下载与设备内存、算力匹配的 GGUF 模型文件。
- 放入模型目录将模型文件放入数据目录下的模型文件夹,便于统一管理。
- 添加模型在「模型配置」页面点击「添加模型」,选择本地模型文件并命名。
- 保存保存后模型出现在模型列表中,可进行加载与切换。
02量化与性能设置
量化等级直接影响占用的内存与推理质量。不同设备应选择不同的量化与上下文配置。
| 配置项 | 说明 | 建议 |
|---|---|---|
| 量化等级 | 如 Q4 / Q5 / Q8,等级越高质量越好、占用越大 | 按设备内存选择,优先保证可运行 |
| 上下文长度 | 模型可同时考虑的 Token 数量 | 按任务复杂度与内存调节 |
| 线程数 | 参与推理的 CPU 线程数 | 按 CPU 核心数配置,避免过热 |
| 设备卸载 | 是否将部分层卸载到 GPU / NPU | 有加速硬件时启用 |
💡 性能调优
若推理过慢或内存不足,可降低量化等级、缩短上下文长度或减少线程数。多模型路由策略可自动为不同任务分配轻量 / 重量模型,详见多模型路由技术文档。
03多模型管理与切换
AGI 支持同时管理多个本地模型,并可按任务类型手动或自动切换。
多模型管理
- ①添加多个模型:按需求导入不同规模、不同用途的模型。
- ②设为默认:指定默认模型,供多数任务使用。
- ③删除模型:移除不再使用的模型以释放磁盘空间。
切换方式
- ①手动切换:在对话或配置中手动选择当前模型。
- ②自动路由:按任务类型(如简单问答 / 复杂推理 / 代码)自动选择合适模型。
- ③降级策略:高负载或资源不足时,自动降级到轻量模型保证可用。
04对话参数调节
对话生成质量可通过参数调节,常见参数如下。
| 参数 | 作用 | 调节建议 |
|---|---|---|
| 温度 (temperature) | 控制输出随机性 | 创作任务偏高,事实问答偏低 |
| Top-P | 核采样,控制候选词范围 | 与温度配合调节 |
| Top-K | 限制最高概率候选词数量 | 默认即可,谨慎调节 |
| 重复惩罚 | 降低重复输出 | 长文本对话建议适当提升 |
💡 按需调节
不同任务适合不同参数组合。建议先保持默认,再根据实际输出效果逐步微调。修改参数后请保存,新参数会在下次推理时生效。