Third Hand:纯文本决策实现亚秒级AI电脑控制
三个月前让 AI 控制电脑还是动辄卡顿五秒、看图点偏的实验室玩具, 今天开源社区用纯文本决策把延迟压进了亚秒级。 0 截屏、0 视觉模型、无需大模型在操作中自回…
清晰拆解了从视觉识别到语义树的技术演进逻辑,用具体对比突出了新方案的效率优势,结构完整且具备实操参考价值。
三个月前让 AI 控制电脑还是动辄卡顿五秒、看图点偏的实验室玩具, 今天开源社区用纯文本决策把延迟压进了亚秒级。 0 截屏、0 视觉模型、无需大模型在操作中自回归生成, 这一步让每个独立开发者都能在自己设备上跑起全天候的自动化流水线。
很多人此前体验大模型控制电脑都有过同一种折磨: 鼠标每点一下, 系统都要截一张几兆的高清全屏图发给云端, 昂贵的视觉大模型在云端死死盯上 3 到 5 秒才吐出几个坐标, 跑完一整套跨软件流程不仅耗时几分钟, 账单还要烧掉好几刀, 甚至稍微遇到分辨率缩放就会当场点歪。
开发者 Shiv 刚刚开源的这套工具 Third Hand, 彻底把这套笨重路线的桌子给掀了。 整个操作桌面、点击按钮甚至决定输入什么内容的过程, 0 截屏、0 视觉大模型介入, 延迟直接压到了亚秒级, 运行成本无限逼近于零。 真正让我觉得把底层逻辑彻底打通的, 是他完全抛弃了让大模型看图数像素的执念。 核心的第一步是把视觉识别降维成系统底层的无障碍语义树。他没有截取任何屏幕像素, 而是通过系统底层的辅助功能直接抓取当前活跃窗口的所有控件列表, 按钮叫什么、输入框在哪全变成结构化文本, 鼠标落点天然具备百分之百的物理确定性。 然后是把自回归长文本生成直接换成状态单选。接入专做强类型决策的 Jev 之后, 系统只负责在一组合法的控件里选出下一步该点谁, 甚至根据任务意图自动匹配要填入的文字, 在 100 毫秒内搞定决策, 话音没落动作已经执行完毕。 这一步彻底打通了大小脑的分工。通用大模型只负责在最开始把长任务拆解成目标清单, 具体的敲键盘、点菜单这种脏活累活, 全部交给底层的无声决策模型去跑, 既不用担心云端思考延迟, 又把每一步的 Token 消耗压成了白菜价。 以前是费劲教大模型看屏幕猜坐标, 从今天起是让操作系统主动交出按钮清单。 如果你的电脑也能挂上这种零成本的亚秒级执行手脚, 你最想让它替你干掉哪个枯燥的日常操作? 我先说, 每天在几个后台之间反复倒腾数据、导出报表再点上传的机械流程, 终于不用忍受漫长的等候卡顿了。 开源代码仓库和核心的三层执行架构, 我整理好放评论区了 https://x.com/sxhivs/status/2101367048223982065/video/1
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力