多模型路由技术文档
AGI 可在设备端同时管理多个本地大语言模型,并按任务类型、负载与资源状况智能路由。本篇解析路由模型的设计、任务分类与匹配、负载管理以及降级策略。
01路由模型设计
多模型路由的核心是:在「能力」与「资源开销」之间取得平衡,为每个任务选择最合适的本地模型。
路由要素
- ①模型档案:每个模型记录能力画像、量化等级、显存内存占用。
- ②任务特征:任务的复杂度、类型与实时性要求。
- ③资源状态:当前内存、CPU / 加速硬件负载与可用性。
- ④路由策略:默认模型、任务匹配规则与降级链。
02任务分类与匹配
智能体在推理前对输入进行分类,并匹配最合适的模型。
| 任务类型 | 匹配倾向 | 说明 |
|---|---|---|
| 简单问答 | 轻量模型 | 低开销、低延迟,适合高频请求 |
| 复杂推理 | 重量模型 | 更高能力,用于多步推理与较难任务 |
| 代码 / 结构化 | 擅长对应领域的模型 | 按模型能力画像匹配 |
| 技能执行 | 兼顾能力与实时性 | 优先保证技能可稳定执行 |
💡 匹配逻辑
匹配逻辑综合任务类型、模型能力画像与当前资源状态,优先选择「能胜任且开销最小」的模型。精细的分类规则可参考模型配置手册进行配置。
03负载与资源管理
本地设备资源有限,路由需考虑并发与占用的平衡。
资源管理机制
- ①占用感知:动态跟踪各模型的显存 / 内存占用。
- ②并发控制:避免同时加载过多模型导致资源耗尽。
- ③按需加载:任务需要时才加载对应模型,空闲时释放。
- ④热切换:在模型间切换时尽可能复用已加载部分,减少开销。
04降级与切换策略
当资源不足或目标模型不可用时,路由自动降级,保证对话可用。
- 资源不足检测到内存或加速资源不足时,优先切换到更轻量的模型。
- 模型不可用目标模型文件缺失或加载失败时,回退到默认 / 次优模型。
- 降级链按预设的降级链逐级回退,直至可用模型。
- 提示与记录降级发生时给出提示并写入日志,便于排查与调优。
📌 关联阅读
降级与本地优先架构的容错机制见本地优先架构技术文档;模型文件与参数的本地管理见模型配置手册。