模型配置手册 · AGI · 红魔团队 Red Magic

模型配置手册

AGI 通过 llama.cpp 在设备端运行大语言模型。本手册介绍模型下载与导入、量化与性能设置、多模型管理与切换策略,以及对话参数调节,帮助你按需配置本地模型。

操作手册llama.cpp

01模型下载与导入

本地模型通常以 GGUF 格式发布,该格式被 llama.cpp 原生支持。请根据设备能力选择合适的模型与量化等级。

  1. 选择模型
    从可信来源下载与设备内存、算力匹配的 GGUF 模型文件。
  2. 放入模型目录
    将模型文件放入数据目录下的模型文件夹,便于统一管理。
  3. 添加模型
    在「模型配置」页面点击「添加模型」,选择本地模型文件并命名。
  4. 保存
    保存后模型出现在模型列表中,可进行加载与切换。

02量化与性能设置

量化等级直接影响占用的内存与推理质量。不同设备应选择不同的量化与上下文配置。

配置项说明建议
量化等级如 Q4 / Q5 / Q8,等级越高质量越好、占用越大按设备内存选择,优先保证可运行
上下文长度模型可同时考虑的 Token 数量按任务复杂度与内存调节
线程数参与推理的 CPU 线程数按 CPU 核心数配置,避免过热
设备卸载是否将部分层卸载到 GPU / NPU有加速硬件时启用
💡 性能调优

若推理过慢或内存不足,可降低量化等级、缩短上下文长度或减少线程数。多模型路由策略可自动为不同任务分配轻量 / 重量模型,详见多模型路由技术文档

03多模型管理与切换

AGI 支持同时管理多个本地模型,并可按任务类型手动或自动切换。

多模型管理

  • 添加多个模型:按需求导入不同规模、不同用途的模型。
  • 设为默认:指定默认模型,供多数任务使用。
  • 删除模型:移除不再使用的模型以释放磁盘空间。

切换方式

  • 手动切换:在对话或配置中手动选择当前模型。
  • 自动路由:按任务类型(如简单问答 / 复杂推理 / 代码)自动选择合适模型。
  • 降级策略:高负载或资源不足时,自动降级到轻量模型保证可用。

04对话参数调节

对话生成质量可通过参数调节,常见参数如下。

参数作用调节建议
温度 (temperature)控制输出随机性创作任务偏高,事实问答偏低
Top-P核采样,控制候选词范围与温度配合调节
Top-K限制最高概率候选词数量默认即可,谨慎调节
重复惩罚降低重复输出长文本对话建议适当提升
💡 按需调节

不同任务适合不同参数组合。建议先保持默认,再根据实际输出效果逐步微调。修改参数后请保存,新参数会在下次推理时生效。