本文仅围绕本地大模型在“养马”(Hermes Agent)和“养虾”(OpenClaw)场景下的使用建议展开,不讨论云端大模型,也不对比二者优劣。若您使用云端模型,请直接关闭本文,无需继续阅读。
当前大模型迭代极快,几乎每隔一段时间就有新版本发布——但其中绝大多数是云端模型,鲜有适合本地部署的版本。真正能在家用机(需配备独立显卡/GPU)上跑起来、且能胜任“养马养虾”任务的模型,选择十分有限。
经过我的一系列对比测试,截至2026年6月,在家用机上效果最好的本地模型是 Qwen3.6-27B。后续我也会持续跟进,更新推荐列表。
需要特别提醒:同系列的 Qwen3.6-35B-A3B 虽然参数标称更大,但它是 MOE(混合专家)架构,推理效果远不如 Qwen3.6-27B,请勿选错。
以 llama.cpp 加载 Qwen3.6-27B 为例,将上下文设为 256K,并分配到两张显卡上,命令如下:
llama-server -m Qwen3.6-27B-Q4_K_M.gguf --host 0.0.0.0 --port 8888 -ngl 99 --tensor-split 22,22 -c 262144 --parallel 1 -t 8 --timeout 1800 --api-key sk-change-me --temperature 0.2 --flash-attn on --keep 16384 --alias qwen3.6:27b --no-ui --context-shift --mlock我使用的两张 N 卡较为老旧,加载完成后约占用 40GB 显存 + 20GB 内存,初始推理速度约为 20 token/秒,效果完全可接受。相比 RTX 40/50 系显卡的价格,这还要啥自行车?
当然,若降低上下文长度或调整 KV Cache,可进一步减少内存占用,但会牺牲使用体验。只要硬件够,建议尽量调大。
官网:https://openclaw.ai
目前网上已有许多中文教程,搭建过程不复杂,此处不再赘述。
但我实测发现,即便为 OpenClaw 设置了 timeoutSeconds 参数且值很大,搭配本地 Qwen3.6-27B 时,任务仍频繁因各类超时而中断。体验下来,OpenClaw 似乎不太适合此本地模型。在试用 Hermes Agent 后,我便彻底放弃了继续折腾 OpenClaw 的动力。
官网:https://hermes-agent.nousresearch.com
同样有很多中文站点可供参考搭建。
坦白说,官方界面的美术风格我欣赏不来——无论是 TUI 还是 Dashboard,都带着浓重的字符界面感。因此,目前社区提供了不少第三方 Web 界面,例如 open-webui,但我更推荐搭配 ekkoye8888/hermes-web-ui,其界面更符合国人使用习惯。
下面给出几组适合的配置参数:
hermes config set agent.reasoning_effort high
hermes config set tool_output.max_bytes 100000
hermes config set tool_output.max_lines 3000
hermes config set code_execution.timeout 600
hermes config set code_execution.max_tool_calls 80
hermes config set terminal.timeout 300
hermes config set compression.threshold 0.65
hermes config set compression.target_ratio 0.3
hermes config set compression.protect_last_n 30在实际使用中,我将 Hermes Agent 搭配 Qwen3.6-27B 模型,让它阅读网页技术文档、设计测试用例并完成功能验证。整个过程推理稳定,没有出现空想或死循环,表现如同一位经验丰富的老手,非常可靠。可以说,Hermes Agent 在本地大模型场景下的实用性很强,效果令人满意。
目前随便写了写,先写到这里吧。感兴趣的朋友欢迎加 QQ群:32777564 一起探讨!