6 月 8 日我发了一个能搜本机内容的 AI 快捷指令,后来越想越不对劲——只能搜东西,算不上 Agent。
Agent 应该能调用工具、能多步推理、能根据上下文调整策略。所以我把之前的推倒重来,重新做了一个纯端侧运行的快捷指令 Agent。骨架和提示词系统已经搭好,剩下的就是把每个功能模块补完——这用不了多久。
技术方案上,底层模型用的是 Gemma 4 Mobile,这个模型很难让快捷指令崩溃的同时性能比肩其他4B模型,很适合端侧场景。核心思路是让模型输出严格的 JSON 来控制工具调度,所有逻辑通过提示词约束,不走云端,完全本地。
硬件方面,兼容配置是 iPhone 15 Pro 及以上机型,iPhone15以下也可以尝试,但可能不稳定
目前已经搭好了一个天气预报工具作为功能验证,证明 JSON 调度链路是通的。剩下的二十多个工具(本机搜索、地图导航、日程、OCR 视觉链、系统控制等等)结构都一样,接入就是体力活。
目前集成的能力
- 本机搜索:相册、消息、邮件、备忘录、提醒事项、联系人、录音
- 天气、位置、附近搜索
- 地图导航 + 行程时间预估
- 截图 与OCR
- 日程创建、记忆管理
- 打电话、发短信
- 音乐播放控制
- 联网搜索
为什么是 Agent?看几个使用场景
场景一:多工具串联
你说"明天下午去机场接人"——它会同时查天气、创建出发和到达两个日程、规划驾车路线并估算时间,最后汇总成一句话告诉你。不是东一个西一个地回复,而是当成一件事来处理。
场景二:看屏幕、看周围、看自己
你说"这是啥"——它不知道你指什么,会先截图OCR识别屏幕内容问你"是这个吗";你说不是,它切后置摄像头拍周围再问你;你还说不是,它切前置拍你再问。三次尝试都失败才放弃,全程自动推进,不需要你教它每一步。
字数限制不列举更多场景
后续计划
所有功能完成后,考虑做一个开源版本,目标是把配置降到几乎零门槛——下载快捷指令、导入模型、跑起来,三步就能到手即用