第十三篇:给 AI 选大脑——主模型与辅助模型配置
Hermes Agent 官方教程第十三篇:配置主模型和辅助模型,让 AI 更聪明也更省钱。
这篇讲的是:如何给 Hermes Agent 配置“主大脑”和“小帮手”,让它在省钱和干活之间找到平衡。
先搞懂:两个“大脑”分工不同
想象 Hermes 是一个团队:
- 主模型 = 团队里的“主脑”。你发的每句话、它回的每个字、中间调用的每个工具,都靠它思考。
- 辅助模型 = 一群“小帮手”。负责压缩聊天记录、看图、总结网页、给会话起标题、判断是否批准命令等杂活。
关键点:每个小帮手都可以单独换人。 你不必让“主脑”干所有事——有些杂活用便宜的小模型就够了,省钱又快。
第1步:打开模型设置页
在 Hermes 仪表盘左侧栏点击 Models,你会看到两个区域:
- Model Settings(上方):分配模型的地方
- Usage analytics(下方):显示最近用过哪些模型、花了多少 token、多少钱
第2步:设置主模型
点击主模型那一行的 Change 按钮,弹出选择器:
- 左栏:显示你已经配置好密钥的提供商(没看到?去 Keys 页面添加)
- 右栏:该提供商推荐给智能体任务的模型列表(不是全部模型,是精挑细选过的)
在搜索框输入名字筛选,选中后点 Switch 即可。
⚠️ 注意:改主模型只对“新会话”生效。 已经打开的聊天窗口仍用旧模型。想热切换当前对话,在聊天里输入
/model命令。
第3步:设置辅助模型
点击 Show auxiliary,展开 11 个任务槽位。每个槽位默认是 auto,意思是“让主模型顺便干”。
什么时候值得单独换? 看这个表:
| 任务 | 建议 |
|---|---|
| Title Gen(起标题) | 几乎一定要换。便宜的小模型起标题和贵的一样好 |
| Vision(看图) | 主模型不支持图片时,换成 google/gemini-2.5-flash |
| Compression(压缩上下文) | 别用贵的推理模型做总结,便宜聊天模型 1/50 价格搞定 |
| Approval(命令审批) | 用快速便宜的模型判断是否自动批准低风险操作 |
操作方式:点某行 Change,选模型,点 Switch。改完会显示 提供商 · 模型 而不是 auto。
想全部还原? 点辅助区域顶部的 Reset all to auto。
第4步:用“Use as”快捷分配
页面上的每个模型卡片都有 Use as 下拉菜单。看到历史记录里某个模型不错?一键把它设为:
- 主模型
- 所有辅助任务(11 个槽位全用这个)
- 某个具体任务(Vision、Web Extract 等)
卡片上会标注 main 或 aux · 任务名,一眼看出当前谁在哪个岗位。
配置写到哪里?
仪表盘保存后,配置写入 ~/.hermes/config.yaml:
# 主模型示例
model:
provider: openrouter
default: anthropic/claude-opus-4.7
base_url: ''
api_mode: chat_completions
# 辅助模型示例(vision 用 gemini-flash)
auxiliary:
vision:
provider: openrouter
model: google/gemini-2.5-flash
base_url: ''
api_key: ''
timeout: 120
# 辅助模型默认 auto 状态
auxiliary:
compression:
provider: auto
model: ''
provider: auto + model: '' 表示“用主模型干这活”。
小总结
主模型决定智商,辅助模型决定性价比。 默认全用主模型没问题,但稍微花几分钟把标题生成、压缩、看图这些杂活分给便宜模型,能省不少钱。
下篇预告: 第十四篇,我们来聊聊 Hermes 的“工具网关”——它如何让 AI 安全地调用外部工具和 API。
📖 官方文档
本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › user-guide/configuring-models