HowTo

具体问题的具体解法。每篇 = 一份可复现的操作步骤 + 为什么这么做的原理辨析 + 踩坑与报错对照表。不是宣传稿,是操作手册。

AI 工具配置

  1. DeepSeek Harness 接入 OpenRouter 的 Ox Alpha(含多模态)
    HT · 00012026-08-22

    三步把 stealth/ox-alpha 接进全新的 DSH,再手加一行让它能读图。附模态声明为何必须手写的原理辨析、视频输入实测(harness 侧硬失败、直连 API 可用但抽帧稀疏且计费不透明)、完整报错对照表与安全提醒。

  2. macOS Harness · browser-use 出品 Coming soon

    给 LLM agent 六个原语(see/key/type/click/ax/script)直接操控 Mac 的"无框架"harness。781 星、9 天冷启动很猛,但还在 v0.1.x:核心原语之一 click 在原生 AppKit 应用(Finder、计算器)上默认路径静默失效(CGEventPostToPid 鼠标事件被 window server 丢弃),修复 PR 还未合并发版。等版本稳下来再写。

论文复现实测

  1. SKILL.state:省 Token 的 Agent 执行架构(复现实测)
    HT · 00022026-09-03

    Google 未开源代码的 arXiv:2608.26263 按论文 Appendix A/B 重新实现四个 runtime,500 货架仓库环境真跑 T=10/25/50。prompt 恒定这条复现成功,论文声称的准确率提升没有复现出来;另外发现输出 token 会翻倍、O(1) 的隐藏前提是状态本身要有界。

  2. WikiSkill:会自己写 Wiki 的 Skill(复现实测)
    HT · 00032026-09-03

    Google Research 未开源代码的 arXiv:2608.27454 按论文重新实现三层工作区 + 四组件,自建 30 题任务集跑三组配置。复现出一个自己踩的审计链 bug(修复前后 0 接受变 1 接受)、一次 val 60→90/test 60→40 的棘轮式过拟合,以及 full-injection 导致的越界触发全过程。