
你看到的"喵",实际上模型一个字都没生成,猫娘是本地代码补上的。
一开始也想过,干脆把一大段人设塞进每次请求。模型每次回复前都得把这段读完。能演猫娘,但上下文越来越重,回答还容易变啰嗦。
所以我换了个思路:模型只留一条短约束,猫娘交给本地渲染——「模型负责干活,界面负责卖萌」
实际上,日志里存的是依旧原文,没有任何关于猫娘的内容。只是界面上再把猫娘补回来。这样下来,模型的上下文并没有被改变,而你看到的还是猫娘。
真实 DeepSeek API 测的(写快速排序 + 保存 + 运行验证):
全程新输入 -67%(12520 → 4178)
稳态缓存命中 -66%(38144 → 12800)
质量无退化,编码 / Web 搜索 / 文件搜索 / 纯问答 / Subagent
数据只对应我这组测试,不是所有任务的统一承诺
为了达成「省 Token 的作用」,插件对工具也做了一些取舍:25 个工具一次性摆给模型,留 8 个常用的。而其余的工具并不常驻,在需要的时候再开。比如 subagent,当模型发现它不在列表里,会先调 enable_tool 打开,再并行派两个子代理,最后再进行汇总。
dsh plugin --profile demo add dsh-catgirl-plugin
然后往 profile patch 里加三行配置(persona / 渲染 / 工具裁剪)
Web UI 渲染再装 dsh-catgirl-plugin-client,完整配置见 README
GitHub:网页链接