赛事:第二届 NVIDIA DGX Spark 黑客松 · 主题「让 Agent 创作一切 · 多模态 Agent 创意挑战赛」 团队:ORULINK(或宇连接) 项目:创造专注 · WacheRobot 多模态识别 & 专注反馈
你有没有过这种感觉——桌面上那个一直陪着你的机器人,明明就在身边,却像个"看不懂你在干嘛"的摆件?
这次黑客松,我们 ORULINK 团队(平时就折腾桌面机器人、嵌入式和 AI Agent)想做一件很日常的事:帮你在办公桌上,创造一段真正专注的时间,再诚实地告诉你,这段时间你做得怎么样。
项目叫 创造专注 · WacheRobot。它不是一个更聪明的聊天工具,而是一个桌面伙伴——
你说一声"开始专注",它就安安静静陪着你;
它在一旁留意几件小事:你还在不在座位、手机有没有拿出来、手边的杯子动没动;
等这段专注结束,它用自己的声音,把一份小结念给你听。
一句话:让 Agent 从屏幕里的输入框,变成桌面上一个能感知、能给反馈、一直陪着你的伙伴。 而"创造专注环境 + 给你真诚反馈",就是我们这次全部叙事的中心。
这届主题是「让 Agent 创作一切」。讲真,又大又空,第一反应都是:写文章?画图?那都卷烂了。
我们反过来想——Agent 现在大多还活在网页窗口里,你得主动开软件、组织提示词、反复切上下文。但桌面机器人不一样,它是物理上"在"你身边的。如果它能既听得懂你的话,又默默观察你的桌面,最后用声音告诉你"你刚才专注了多久"——这难道不是 Agent 从屏幕走向桌面的第一步?
方向定了,但黑客松最忌讳"什么都想做"。我们给自己划了一条很硬的边界:
❌ 不读屏幕、不做 OCR、不识别你是谁、不判断你情绪
✅ 只把一件事做扎实:创造一个专注环境,并给出诚实的反馈
为什么这么克制?因为我们的摄像头最高只有 640×480。这个分辨率放大了看,连你屏幕上的字都是马赛克。硬上 OCR 纯属自取其辱。
Makers 的第一课就是:别跟硬件对着干,顺着它的脾气来。 所以我们只盯三件"大目标"——人在不在工位、手机露没露、杯子动没动。这些低分辨率下也能稳定看出来的东西,才是我们的战场。
真正的痛点来了:能看懂画面的模型眼力很好,但你让它每一帧都推理,它跟你说话时就卡住了——体验直接废掉。
我们的解法是让机器人分成"两个自己":
🟢 反应快的自己 · 负责立刻回你、给你播报
听懂你的中文指令,用轻量模型立刻回一句
专注结束时,用它自己的声音把小结念出来
🟣 看得细的自己 · 负责后台慢慢观察
眼睛来自 StepFun(阶跃星辰)的 Step3-VL-10B 多模态模型,按时间顺序吃掉几张快照
攒一批、分析一批,绝不逐帧打断你
设计哲学一句话:让"立刻回话"和"可以等的深度观察"分开跑。 你说话的时候,看得细的那个先让一让;你说完,它再接着看。这样你永远感觉不到延迟,却始终有人"在旁边看着"。
实话说,这个项目能跑在"桌面"上而不是"云"里,靠的是三股力量叠在一起。不把它讲清楚,这篇文章就不完整。
① NVIDIA DGX Spark:把"超算"搬到了桌面上 DGX Spark 是英伟达(NVIDIA)推出的桌面级 AI 超算——一台巴掌大小、却内建 GPU 和 128GB 统一内存的小盒子。对我们要做的"端侧多模态 Agent"来说,它几乎是量身定做:感知、推理、统计、播报全在本地完成,画面和声音不外传,这才有了前面说的隐私闭环。换句话说,是 DGX Spark 让"机器人跑大模型"这件事,第一次能放在你办公桌上,而不是锁在机房里。
② 英伟达生态:让端侧多模态真正"能跑" 光有硬件不够。DGX Spark 背后是整套 NVIDIA 生态——统一内存架构让 CPU 与 GPU 共享同一块 128GB 内存,10B 级别多模态模型、语音识别、轻量语言模型和语音合成才能在同一台设备里并存不打架;FP8 低精度推理、vLLM 这类工具链,也让我们能在这块 ARM64 小盒子里把大模型压到"可实时观察"的程度。正是英伟达的硬件 + 软件栈一起发力,把"桌面机器人跑大模型"从 PPT 拽成了真机。
③ StepFun(阶跃星辰):那个"看得细的自己" 慢系统背后的眼睛,是 StepFun(阶跃星辰)的 Step3-VL-10B 多模态模型。它帮了我们两件事:
真能看懂画面:640×480 这种低清画面信息极少,但 Step3-VL 能基于多帧变化,稳定判断"人在不在 / 手机露没露 / 杯子动没动";
能结构化输出、不瞎编:我们只让它吐 JSON(状态 / 变化 / 置信度),低置信度统一记成"不确定",比例和次数再交给确定性代码算。这也对应了 GitHub 里那条 fix: 避免 Step3 照抄零置信度示例——我们特意卡住了模型"编故事"的口子。
一句话总结这三者的关系:英伟达(DGX Spark + 生态)给了"能跑大模型的桌面",StepFun 给了"能看懂桌面的眼睛",两者叠起来,才让"创造专注"这种端侧多模态 Agent 有了落地的底气。
光说架构太空了。这是我们开源仓库 orulink-ai/SparkHT-Focus-Demo 真实的 commit 时间线(北京时间 7/22 当天 14:10 → 22:34),我基本是按它复盘的全过程 👇
feat: 搭建 SparkHT 端侧专注统计快慢双系统
test: 补全端侧网关集成验证与运行手册
第一件事不是写功能,是先把"端侧网关"这条连接机器人的路打通——毕竟机器人固件同一时间只认一个前台应用,麦克风、相机、扬声器得由我们统一接管。骨架立住,后面才好往上堆。
fix: 隔离会话视觉任务并记录真机首音时延
fix: 稳定 Step3 FP8 结构化多图推理
fix: 稳定真机重连与视觉批次收尾
fix: 避免 Step3 照抄零置信度示例
这一段全是"踩坑→修"。最要命的是首音时延——你刚说完话,机器人多久才出声,这直接决定它"像不像个活物"。我们把视觉任务隔离出去,你说话时立刻暂停观察,确保回话永远优先。
这里出力的 Step3,就是阶跃星辰(StepFun)的 Step3-VL 多模态模型——前面说的"看得细的自己",全靠它在本地 DGX Spark 上完成。另一个坑是大模型爱"瞎编"。我们只让它输出结构化结果(人在/手机/杯子/变化/置信度),低于置信度的统一记成"不确定",比例和次数全由确定性代码算,不让模型自由发挥。这样反馈可验证、不夸大。
feat: 根据机器人状态播放表情动画
feat: 增加专注入场动作与循环表情
feat: 根据机器人状态编排灯光颜色
fix: 避免噪声触发表情状态
光会说话还不够"伙伴感"。我们让它根据状态切表情、亮不同的灯:专注中是一种稳态,思考时是另一种,结束播报时再换过来。中间修了好几轮"表情乱跳""被噪声误触发"——这些细节,才是 demo 现场让人会心一笑的地方。
feat: 将实时专注状态注入语音对话
feat: 重构专注仪表盘(紧凑纵列 / 带鱼屏横向两版)
feat: 增加演示视频草稿生成工具
专注进行中你随口问"现在怎么样了",它会先放下观察、立刻回你,再接着看。我们也顺手把仪表盘做成能跟着会话自动刷新,外加一个生成演示视频草稿的小工具——黑客松交差就靠它。
docs: 整理黑客松项目交付文档
build: 增加质量检查与交付打包脚本
docs: 更新开源仓库入口与测试基线
最后把所有东西打包、写好运行手册,把仓库整理干净开源出去。对你我这种 maker 来说,能跑、能复现、能 clone 下来自己玩,比一份漂亮的 PPT 重要一万倍。
我们用 90 秒跑一段真实的专注会话,全程数据来自真实运行,没有一帧是假的:
你对机器人说:"开始专注。"
它应一声,一段专注时间开始。
摄像头每 10 秒抓拍一张(暖机后单次抓拍中位约 473.8 ms,P95 约 555.1 ms),每几张组成一批,丢给"看得细的自己"慢慢看。
你中途问"现在统计到哪了",它暂停观察、先回你话。
时间到了,自动生成一份网页小结,并用它自己的声音播报。
杯子动了,我们只会说"疑似杯子移动",绝不声称你喝了水。这就是我们反复强调的边界感——不夸大它能做的事,看不见的就老实说看不见。
从"读清细节"转向"理解变化"。 单帧 640×480 信息极少,但多帧的时间变化能撑起"人在不在、手机露没露、杯子动没动"的统计。受限硬件也能玩出多模态价值。
观察与统计解耦,反馈才可信。 模型只输出观察,计算交给确定性代码。可验证、抗幻觉,这是我之后做端侧 Agent 会一直用的套路。
端侧隐私闭环。 感知、推理、统计、播报全在本地 DGX Spark 完成。原始画面和报告默认一段时间自动清理,demo 连麦克风音频都不存。放在办公桌、实验室、展陈空间才安心。
128GB 统一内存是真香。 CPU/GPU 一致性统一内存,让多模态模型、语音、轻量语言模型能在同一台桌面设备并存。这就是端侧多模态 Agent 的算力底气。
12 小时,从端侧网关,到快慢调度,到表情和灯光,到真机跑通一段 90 秒专注会话,再到把仓库整理开源——我们把它做成了一个完整、明确的起点,而不是一个 PPT 玩具。
"让 Agent 创作一切"不只是生成更多内容,更是创造一种新的相处方式:技术不该只在屏幕里等你输入,它也可以安静地待在你桌上,帮你留住一段专注的时间,再真诚地告诉你——你做得很好。
而这件事能真正落地,离不开三股力量叠在一起:英伟达 DGX Spark 给了"能跑大模型的桌面",NVIDIA 生态(统一内存 + FP8/vLLM 工具链)给了端侧多模态"能跑"的软件底座,而 StepFun(阶跃星辰)的 Step3-VL 给了"能看懂桌面的眼睛"。没有这套组合,桌面机器人跑大模型就还只是 PPT。
如果你也在折腾桌面机器人、端侧多模态部署,或者单纯好奇"Agent 怎么从屏幕里走出来"——欢迎在评论区聊聊。我们下一步想往"长期工作节律""低打扰陪伴"方向做,也欢迎一起来卷 😉
团队:ORULINK(或宇连接(深圳)科技有限责任公司) 赛事:第二届 NVIDIA DGX Spark 黑客松 · 多模态 Agent 创意挑战赛 项目:创造专注 · WacheRobot 多模态识别 & 专注反馈 开源:github.com/orulink-ai/SparkHT-Focus-Demo