finding-unknowns-skills 给了 8 个能装的技能,横跨动手前、写着时、写完后三个阶段,点子取自 Anthropic 工程师 Thariq Shihipar 的《Finding Your Unknowns》一文
这八个分别是
blindspot-pass(掀出未知未知)
brainstorm-prototypes(做一次性原型定调性)
interview-me(一次问一个问)
reference-hunt(拿现成源码当规格)
implementation-plan(把最可能改的决策放最前)
implementation-notes(记偏离)
pitch-packager(打包成说服文档)
change-quiz(合并前先考过)。
https://github.com/Neeeophytee/finding-unknowns-skills
Hermes/OpenClaw | AI探索
这八个分别是
blindspot-pass(掀出未知未知)
brainstorm-prototypes(做一次性原型定调性)
interview-me(一次问一个问)
reference-hunt(拿现成源码当规格)
implementation-plan(把最可能改的决策放最前)
implementation-notes(记偏离)
pitch-packager(打包成说服文档)
change-quiz(合并前先考过)。
https://github.com/Neeeophytee/finding-unknowns-skills
Hermes/OpenClaw | AI探索
QA 的:
1. 大部分要交给自动化测试,也就是实现功能的时候要同步实现自动化测试代码,现在 Agent 这方面能力很强,稍微引导一下即可
2. 人做黑盒测试,不看具体实现,验证功能完整性、边界条件、极端测试(数据很大之类)、安全性等等
https://x.com/bernadine53742/status/2078383900133667005?s=20
Hermes/OpenClaw | AI探索
1. 大部分要交给自动化测试,也就是实现功能的时候要同步实现自动化测试代码,现在 Agent 这方面能力很强,稍微引导一下即可
2. 人做黑盒测试,不看具体实现,验证功能完整性、边界条件、极端测试(数据很大之类)、安全性等等
https://x.com/bernadine53742/status/2078383900133667005?s=20
Hermes/OpenClaw | AI探索
claude code和codex都有大量prompt和instructions,要求agent在非常长的任务无法完成的时候,整个任务直接停止掉,给一个汇报告诉用户为什么无法完成,做到了哪一步。
我一直说,这是最差的设计,multi agent还是goal driven的停止权必须100%掌握用户手里,用户决定停止任务的判定条件,而不是 agent 本身。
现在这个屎山已经删不掉了,会非常耽误事的。
技术发展路线再一次证明,agent的整个工作流程的控制,包括写死goal在agent而不是向我一样提出用goal driven,包括plan mode写死在agent功能里,包括skills写死在agent里,都是极其严重的错误方向,这些最终都会成为庞大屎山的一部分。
唯一正确的方式,是把这些skills、structured memory、goal driven、plan mode这些设计一层层全部剥离出来,从agent里全部删掉,全部交给用户,让用户自由选择。
当然agent可以在上面新建一层,帮助用户排列组合,但永远不应该写死这些在agent里。
Hermes/OpenClaw | AI探索
我一直说,这是最差的设计,multi agent还是goal driven的停止权必须100%掌握用户手里,用户决定停止任务的判定条件,而不是 agent 本身。
现在这个屎山已经删不掉了,会非常耽误事的。
技术发展路线再一次证明,agent的整个工作流程的控制,包括写死goal在agent而不是向我一样提出用goal driven,包括plan mode写死在agent功能里,包括skills写死在agent里,都是极其严重的错误方向,这些最终都会成为庞大屎山的一部分。
唯一正确的方式,是把这些skills、structured memory、goal driven、plan mode这些设计一层层全部剥离出来,从agent里全部删掉,全部交给用户,让用户自由选择。
当然agent可以在上面新建一层,帮助用户排列组合,但永远不应该写死这些在agent里。
Hermes/OpenClaw | AI探索
files.md 是个本地优先的 .md 笔记应用,浏览器直接打开就能用、数据全留在自己机器上,主打类聊天的随手记、任务清单、日记,外加可选的同步和 Telegram 机器人。
https://github.com/zakirullin/files.md
Hermes/OpenClaw | AI探索
https://github.com/zakirullin/files.md
Hermes/OpenClaw | AI探索
我重新筛了一版:6 个值得收藏的视频剪辑 Agent 项目。
这次不只看“名字像不像剪辑工具”,而是按两个标准选:
1. Star 和社区热度
2. 是否真的适合沉淀成视频工作流
前 5 个看成熟度,第 6 个虽然小,但最贴 Codex Skill 场景。
Hermes/OpenClaw | AI探索
这次不只看“名字像不像剪辑工具”,而是按两个标准选:
1. Star 和社区热度
2. 是否真的适合沉淀成视频工作流
前 5 个看成熟度,第 6 个虽然小,但最贴 Codex Skill 场景。
Hermes/OpenClaw | AI探索
我在整个2026年一直复读的一个观点:抄劣质skills的人、瞎装skills的人、瞎用skills的人、瞎鸡巴学skills的人,是同一波大傻逼,无一例外
Hermes/OpenClaw | AI探索
Hermes/OpenClaw | AI探索
👍1
Hermes Agent 每次会从头开始,缺一个跨会积累记忆、信念和成长轨迹的持久层。
https://github.com/PabloTheThinker/hermespace
Hermes/OpenClaw | AI探索
https://github.com/PabloTheThinker/hermespace
Hermes/OpenClaw | AI探索
👍1
阿里开源的 page-agent:一行 <script> 就给任意网页装上 AI Agent。
总 star 27,525,fork 2,411,Trendshift 收录。最新版本 v1.12.2,昨天还在提交代码,31 页贡献者。
它解决的是「网页 Agent 太重」这个问——现在做浏览器自动化,基本都要装 Chrome 插件、跑 Python、起 headless 浏览器,用户端根本落不了地。page-agent 反过来做:纯页面内 JavaScript,不装插件、不开后端、不截图。
文本化 DOM 操作 — 不走截图路线,因此不需要多模态大模型,也不用申请特殊权限
自带模型接入 — 主流模型都能接,包括本地部署的(README 示例用的是 qwen3.5-plus)
可选 Chrome 扩展 — 需要跨标签页的多页面任务时再加,不是必需
MCP Server(Beta) — 让外部 agent 客户端反过来控制你的浏览器
npm 直接装 — npm install page-agent,两行代码 agent.execute('点击登录按钮')
它明确说了自己的定位是客户端网页增强,不是服务端自动化,DOM 处理和 prompt 部分基于 browser-use 改的,MIT 协议。
适合:
做 SaaS / ERP / CRM 后台,想给产品塞个 copilot 但不想重写后端的
表单流程长到 20 次点击起步,想压成一句的内部系统团队
做无障碍访问,需要让网页能被自然语言驱动的
🔗 https://github.com/alibaba/page-agent
Hermes/OpenClaw | AI探索
总 star 27,525,fork 2,411,Trendshift 收录。最新版本 v1.12.2,昨天还在提交代码,31 页贡献者。
它解决的是「网页 Agent 太重」这个问——现在做浏览器自动化,基本都要装 Chrome 插件、跑 Python、起 headless 浏览器,用户端根本落不了地。page-agent 反过来做:纯页面内 JavaScript,不装插件、不开后端、不截图。
文本化 DOM 操作 — 不走截图路线,因此不需要多模态大模型,也不用申请特殊权限
自带模型接入 — 主流模型都能接,包括本地部署的(README 示例用的是 qwen3.5-plus)
可选 Chrome 扩展 — 需要跨标签页的多页面任务时再加,不是必需
MCP Server(Beta) — 让外部 agent 客户端反过来控制你的浏览器
npm 直接装 — npm install page-agent,两行代码 agent.execute('点击登录按钮')
它明确说了自己的定位是客户端网页增强,不是服务端自动化,DOM 处理和 prompt 部分基于 browser-use 改的,MIT 协议。
适合:
做 SaaS / ERP / CRM 后台,想给产品塞个 copilot 但不想重写后端的
表单流程长到 20 次点击起步,想压成一句的内部系统团队
做无障碍访问,需要让网页能被自然语言驱动的
🔗 https://github.com/alibaba/page-agent
Hermes/OpenClaw | AI探索
❤1👍1
不知道为什么一堆人天天臭骂claude code和codex影响硬盘。
你干的那些活儿,天天装一堆,本身就会影响NAND寿命,不让它干,你自己干同样工作量的活儿,NAND寿命也会同等损耗。
你不舍得你那点NAND颗粒寿命,就买个大内存型号mac,创建个RAM disk,在这个drive里踏踏实实干活儿,或者外接个移动硬盘。
Hermes/OpenClaw | AI探索
你干的那些活儿,天天装一堆,本身就会影响NAND寿命,不让它干,你自己干同样工作量的活儿,NAND寿命也会同等损耗。
你不舍得你那点NAND颗粒寿命,就买个大内存型号mac,创建个RAM disk,在这个drive里踏踏实实干活儿,或者外接个移动硬盘。
Hermes/OpenClaw | AI探索
支持,intel optane非常适合claude code这种抓住一小块storage疯狂randomly write/read的场景了。
我强烈建议所有人,为了你的claude code工作顺滑度,为了background task快速完成,反复装卸大量包,保存你宝贵的macbook的NAND颗粒硬盘寿命,
买一块二手intel optane当agent工作硬盘,就是最优解。
Hermes/OpenClaw | AI探索
我强烈建议所有人,为了你的claude code工作顺滑度,为了background task快速完成,反复装卸大量包,保存你宝贵的macbook的NAND颗粒硬盘寿命,
买一块二手intel optane当agent工作硬盘,就是最优解。
Hermes/OpenClaw | AI探索
Agent的一个瓶颈是inference过慢,这个是O(N)的复杂度,因为一个巨大的任务总是要顶着LLM inference上限reasoning,
另一个瓶颈是某些高强度的task,这个甚至可以是O(2^N)的指数级复杂度,可能recursively执行bash、测试、调试、等待其他API call的工作,
当一个codebase足够大,光跑test浪费的时间 ,就足够一次浪费个十几分钟,那么你就要自己profiling,看看到底瓶颈在哪里。
一个理想状态是,你有无限个agents in parallel,每个agent可以自动执行无限个tasks in parallel,asynchronously,但现实一定是不可行的。
其中一些任务在CPU core和threads上,一些在RAM上,一些在storage file I/O上,intel optane就解决的是最后一个问,因为启动一个干净的repo+安装足够多的dependency本身也会浪费很多时间。
Hermes/OpenClaw | AI探索
另一个瓶颈是某些高强度的task,这个甚至可以是O(2^N)的指数级复杂度,可能recursively执行bash、测试、调试、等待其他API call的工作,
当一个codebase足够大,光跑test浪费的时间 ,就足够一次浪费个十几分钟,那么你就要自己profiling,看看到底瓶颈在哪里。
一个理想状态是,你有无限个agents in parallel,每个agent可以自动执行无限个tasks in parallel,asynchronously,但现实一定是不可行的。
其中一些任务在CPU core和threads上,一些在RAM上,一些在storage file I/O上,intel optane就解决的是最后一个问,因为启动一个干净的repo+安装足够多的dependency本身也会浪费很多时间。
Hermes/OpenClaw | AI探索
This media is not supported in your browser
VIEW IN TELEGRAM
字节开源 UI-TARS-desktop,GitHub 已经 3.8 万星。
本地原生 GUI Agent,用自然语言直接操控电脑和浏览器:看屏幕、点鼠标、敲键盘,支持本地/远程操作,跨平台,数据全本地跑。
旁边还有 Agent TARS 那一套 CLI + MCP,把 GUI 能力接到终端和真实工具链里。
真正能干活的开源多模态 Agent Stack。
Hermes/OpenClaw | AI探索
本地原生 GUI Agent,用自然语言直接操控电脑和浏览器:看屏幕、点鼠标、敲键盘,支持本地/远程操作,跨平台,数据全本地跑。
旁边还有 Agent TARS 那一套 CLI + MCP,把 GUI 能力接到终端和真实工具链里。
真正能干活的开源多模态 Agent Stack。
Hermes/OpenClaw | AI探索
👍1
中文内容创作者,必装的 10 个 skill
1|Humanizer-zh
中文"去 AI 味"神器,专抓空、套、三段式、过度排比那股机器腔,改得像人写的(归藏做的汉化版)。
https://github.com/op7418/Humanizer-zh
2|dbskill
内容"选诊断器",帮你诊断商业表达、抠 hook、拆爆款、想小红书标。
https://github.com/dontbesilent2025/dbskill
3|content-research-writer
从选、找资料、列提纲到初稿,一条写作流跑通,公众号、长文、Newsletter 都能写。
https://github.com/openakita/openakita(skills/content-research-writer)
4|notebooklm-skill
让 NotebookLM 先查资料、Claude 再动笔,基于你的资料库写,少胡编,适合深度文和行研。
https://github.com/claude-world/notebooklm-skill
5|khazix-skills
卡兹克开源的写作合集,写作流偏重,适合啃 AI 热点分析、万字长文、深度观点。
https://github.com/KKKKhazix/khazix-skills
6|ian-xiaohei-illustrations
正文配图神器,把观点、流程、情绪画成"小黑"手绘插图,不是随便甩你一张图。
https://github.com/helloianneo/ian-xiaohei-illustrations
7|guizang-social-card-skill
写完文章直接切成小红书图文和公众号封面,一篇长文拆成多张能发的卡片。
https://github.com/op7418/guizang-social-card-skill
8|baoyu-skills
宝玉做的视觉工具箱,封面、信息图、结构图、图解都能出,专管文章包装。
https://github.com/jimliu/baoyu-skills
9|guizang-ppt-skill
把文章观点做成 PPT、演讲图、公众号头图、小红书封面,二次分发省事。
https://github.com/op7418/guizang-ppt-skill
10|html-anything
把 Markdown、
1|Humanizer-zh
中文"去 AI 味"神器,专抓空、套、三段式、过度排比那股机器腔,改得像人写的(归藏做的汉化版)。
https://github.com/op7418/Humanizer-zh
2|dbskill
内容"选诊断器",帮你诊断商业表达、抠 hook、拆爆款、想小红书标。
https://github.com/dontbesilent2025/dbskill
3|content-research-writer
从选、找资料、列提纲到初稿,一条写作流跑通,公众号、长文、Newsletter 都能写。
https://github.com/openakita/openakita(skills/content-research-writer)
4|notebooklm-skill
让 NotebookLM 先查资料、Claude 再动笔,基于你的资料库写,少胡编,适合深度文和行研。
https://github.com/claude-world/notebooklm-skill
5|khazix-skills
卡兹克开源的写作合集,写作流偏重,适合啃 AI 热点分析、万字长文、深度观点。
https://github.com/KKKKhazix/khazix-skills
6|ian-xiaohei-illustrations
正文配图神器,把观点、流程、情绪画成"小黑"手绘插图,不是随便甩你一张图。
https://github.com/helloianneo/ian-xiaohei-illustrations
7|guizang-social-card-skill
写完文章直接切成小红书图文和公众号封面,一篇长文拆成多张能发的卡片。
https://github.com/op7418/guizang-social-card-skill
8|baoyu-skills
宝玉做的视觉工具箱,封面、信息图、结构图、图解都能出,专管文章包装。
https://github.com/jimliu/baoyu-skills
9|guizang-ppt-skill
把文章观点做成 PPT、演讲图、公众号头图、小红书封面,二次分发省事。
https://github.com/op7418/guizang-ppt-skill
10|html-anything
把 Markdown、
文案变成好看的 HTML 页面、海报、卡片、PNG,杂志风、知识卡都能做。
https://github.com/clockless-org/html-anything
Hermes/OpenClaw | AI探索
https://github.com/clockless-org/html-anything
Hermes/OpenClaw | AI探索
这两天终于把 BaoCut 的视频画面翻译功能做了,这功能技术实现不复杂,但是交互比较麻烦,也没有同类产品借鉴参考,迭代了好几个版本终于觉得还不错了。
亮点是可以 Agent(推荐 Codex)自动化操作,不用人工干预,另外翻译好的结果,可以直接导出到剪映(CapCut)二次处理。
用起来倒是很简单:
一种是自己去 Agent 那边,让 Agent 自己找出来需要翻译的画面帧,然后翻译后把翻译后的文字加到 OCR 出来的位置。
参考提示词:
> 帮我转录翻译 <视频地址>,并为所有全屏的 slides (不是背景中的)也添加翻译
一种是自己从 GUI 主动在要翻译的位置暂停,然后点击播放器下面的 Screen Text 按钮,就能对当前画面进行 OCR,找出来所有文字位置,当然人工可以勾选哪些需要翻译的。
最开始的版本是一次翻译一张,后来发现太慢,现在改成了添加到队列,批量翻译,效率就快多了。
之所以没有做成图片翻译替换画面,是因为视频画面是动态的,如果只是替代一帧或者几帧,效果并不好,就折衷了一下,做成了字幕叠加在原始文字上,人工可以二次调整。
如果你还不是最新版本需要升级到最新版本(v0.8.2)。
下载地址:https://baocut.app/
Hermes/OpenClaw | AI探索
亮点是可以 Agent(推荐 Codex)自动化操作,不用人工干预,另外翻译好的结果,可以直接导出到剪映(CapCut)二次处理。
用起来倒是很简单:
一种是自己去 Agent 那边,让 Agent 自己找出来需要翻译的画面帧,然后翻译后把翻译后的文字加到 OCR 出来的位置。
参考提示词:
> 帮我转录翻译 <视频地址>,并为所有全屏的 slides (不是背景中的)也添加翻译
一种是自己从 GUI 主动在要翻译的位置暂停,然后点击播放器下面的 Screen Text 按钮,就能对当前画面进行 OCR,找出来所有文字位置,当然人工可以勾选哪些需要翻译的。
最开始的版本是一次翻译一张,后来发现太慢,现在改成了添加到队列,批量翻译,效率就快多了。
之所以没有做成图片翻译替换画面,是因为视频画面是动态的,如果只是替代一帧或者几帧,效果并不好,就折衷了一下,做成了字幕叠加在原始文字上,人工可以二次调整。
如果你还不是最新版本需要升级到最新版本(v0.8.2)。
下载地址:https://baocut.app/
Hermes/OpenClaw | AI探索