en
Feedback
Reorx’s Forge

Reorx’s Forge

Open in Telegram

A chronicle of my journey in forging my ideas into writings and products. Archive: https://app.shokichan.com/c/tg/reorx_share

Show more
3 158
Subscribers
+1424 hours
+307 days
+5230 days
Posts Archive
用 Strongbox 好多年了,今天才发现,2年前出了一个新功能 Strongbox Sync, 解决了竞态读写的问题。之前我一直用的基于文件系统的方式读写密码库,在多设备同时使用时容易产生冲突,iCloud/OneDrive 会在冲突发生时生成一个新文件,时间长了就发现放密码库的目录里多出来一堆带设备名后缀的冗余文件… 新的 Sync 功能由于用了 CloudKit API, 能强制写入操作立刻发生并确保获得成功/失败的回执,使得同步的处理更加稳定可靠。 https://strongboxsafe.com/strongbox-sync/ 于是我把之前的 .kdbx 文件转化成了 Strongbox Sync 类型的数据库,测试了下同步速度也比之前的 iCloud 文件要快,iOS 和 MacOS 同时开启应用添加两个不同的条目,冲突自动解决,不用重新打开密码库就能立即看到另一侧的条目同步过来。效果确实不错。唯一的问题是看不到实体的 .kdbx 文件总觉得有点担心,好在可以定时导出进行备份。 所以如果你主要使用苹果全家桶的话,Strongbox 是一个非常不错的选择,原本它的短板是继承自 KeePass 的单文件竞态写入冲突,但现在通过 CloudKit 完全解决了这个问题。而且它是一个一次性付费的软件,且直到今天仍持续更新。我已经用了8年,目前看来还会继续用下去。

这也是个很不错的润色结果,我在说话的过程中就发现实时转录把「竞态」当成了「静态」,于是补了一句说明,最后成功修复了这个问题,避免了一次手动修改
这也是个很不错的润色结果,我在说话的过程中就发现实时转录把「竞态」当成了「静态」,于是补了一句说明,最后成功修复了这个问题,避免了一次手动修改

非常好的生活小技巧,我补充一个用法:优化项目的 AGENTS.md。之前 Fable 限时的时候,我一看明天就没得用了,还剩不少额度,就用 Fable 把最近一年碰过的所有项目都刷新了下。提示词如下:
基于目前项目的状态,以及你自己的知识和能力,分析 @AGENTS.md ,对其进行优化和精简:
- 精简语言表达
- 删掉那些冗余的信息
- 删掉不重要的信息,这里写的应该只有一个 agent 在此项目工作时最需要知道的信息
- 改掉过时的信息,keep in sync with the current
- 对于占据大段篇幅的内容,如业务逻辑流程等,考虑将其单独拆成文件放到 kb/docs/ 下,再引用回来
https://t.me/dps_build/687

草,一打开就看到友邻转发友邻们对我的转发
草,一打开就看到友邻转发友邻们对我的转发

我很喜欢这个比喻,Anthropic 的模式很像是当年的 IBM,垄断大型机与专业软件,后来 PC 靠足够好用 + 自由组装把 IBM 的市场分化掉了。所以现在开源/开放权重模型的意义就在于避免闭源模型巨头对个人使用 AI 的权利的侵蚀——我可以在有能力接近的开源模型的情况下依然选择使用 Claude, 但我不能接受只能选择 Claude 的世界 https://news.ycombinator.com/item?id=49079405

更新下语音输入法的进展,这两天在打磨录音触发和音频传输的细节,务求做到极致的响应速度和稳定性,不弄丢任何声音。然后刚刚输入了很长一段话,整体输出质量已经非常高了,我甚至觉得比 typeless 更让我满意。
更新下语音输入法的进展,这两天在打磨录音触发和音频传输的细节,务求做到极致的响应速度和稳定性,不弄丢任何声音。然后刚刚输入了很长一段话,整体输出质量已经非常高了,我甚至觉得比 typeless 更让我满意。

还有5分钟 Fable 额度 reset,充分利用下最后 2% ,和它聊会天
还有5分钟 Fable 额度 reset,充分利用下最后 2% ,和它聊会天

不知道为什么 Hacker News 上的讨论氛围现在还对 HTMX 如此狂热。agentic coding 之前的时代,我也是很看好 HTMX 的,觉得它把 web 开发拉回了那种经典朴素的路子,不像 React 搞那么多概念。 但这几个月我几乎没亲手写过代码,全是 claude code / codex 在干活,突然发现我根本不在乎底下是 HTMX 还是 React 了。代码都不是你写的,你纠结这个干嘛? 甚至开始体会到 React 的好:生态成熟、UI 库多、模块化组件复用,这些恰恰是 HTMX 的短板。但帖子里完全没人提,do you guys not have AIs? https://news.ycombinator.com/item?id=49057241

远程 ssh 工作时感觉 Mac Mini 有点卡,查了下系统状态发现差点爆了,赶紧让 claude 自修复一波。最后发现是 agent-browser 进程泄露和 ios simulator 没关导致的…这算是最近用 agent 自验收比较多的一个
+2
远程 ssh 工作时感觉 Mac Mini 有点卡,查了下系统状态发现差点爆了,赶紧让 claude 自修复一波。最后发现是 agent-browser 进程泄露和 ios simulator 没关导致的…这算是最近用 agent 自验收比较多的一个副作用吧,看来得做个 crontab 定期清理下进程

Simplicity is prerequisite for reliability. — Edsger W. Dijkstra 只凭这一句话,Dijkstra 就是我最崇敬的计算机科学大师之一

忙碌的一周结束了,驻足欣赏下江景

过去半年 AI 编程给我的工作方式带来的最大变化,不是写的代码质量更高,或者可以完成的 feature 难度更高,而是在测试验收和运维部署这两件事上,极大拓展了我对它的想象空间,并建立了前所未有的信任。 之前我曾尝试用 OpenClaw 帮我把已完成的工作发布上线,但得到的效果却不能让人满意,还让我花了大量的时间给 AI 擦屁股。我心说可能是我贪心了,运维的复杂度高,需要与各种 GUI 管理工具交互、频繁切换上下文,并且需要相比代码开发更严谨、更具有怀疑精神的心智模型。为此我还写了篇文章思考 DevOps 专用 agent 的需求和可行性。 然而最近几个月,事情开始变得不一样了。我时常在 X 上看到有人给 Codex / Claude Code 下达一个高层级目标,对如何完成的过程没有任何提示或约束,agent 却能完全自主完成一系列 GUI 工具的操作,像一个真实的 sysadmin 那样完成任务:登录运维平台配置域名、服务器等云资源,甚至在供应商的网站上创建账号、购买服务,最后拿到 API Key 等等。第二天早上一看,完整的产品已经上线并 SEO ready 了。 这类宣传虽然诱人,但有之前的失败经历在,我一直比较谨慎。所以直到 Fable 发布,我才重新尝试把完整的上线、验收的全流程交给 agent 来完成,结果是一次次让我惊喜,最终使我彻底将 DevOps 工作以 IaC 的方式移交给了 agent。在测试方面,我也从只让 agent 写单元测试、自己手动验收,进化到全部交给 agent 运行和模拟操作,我只看结果的截图。其实连截图我也很少看——agent 本就是自己对着截图确认的,多数情况我只看结论就够了。 这种能力边界的拓展,其基础是 harness 与模型的双向进步。harness 的上下文管理在持续优化,与现实世界交互的工具生态越来越丰富和成熟(如 computer use、agent-browser,甚至 iOS simulator);模型训练向 agent 相关的评测指标看齐,并以长时间独立执行任务为核心目标,在今年不断突破新的高度。 我对 AI 编程工作流的下一步想象,就是脱离对终端和 TUI 的操作,在一个中心化的系统中管理开发任务从需求到上线的全生命周期:探讨需求并生成 spec,在合适的时机方便地引入 human-in-the-loop,自动 handoff 并 spawn 新的 session,自动 review、验收、截图、生成报告,自主管理整个 DevOps 体系等等等等。这个想法已经有不少开源项目在实践了,但能真正达到我的标准,达到与我手动在 Claude Code 里交互相同甚至更好的手感和稳定性,还差一些。因为对我来说,生产力工具不是能用就行,必须足够稳定可控,不因自身的问题打断使用者的心流,也不让人把时间浪费在调试和配置上。不过以现在的进步速度,保守估计最迟年底,我的工作方式就会变成这样,拭目以待吧。

最近经常遇到 Chrome 动不动占很多 CPU,打开 Task Manager 看到 CPU 最高的一项永远是 Prerender: https://www.google.com/search/warmup.html, 搜了下或许关闭 Preloa
最近经常遇到 Chrome 动不动占很多 CPU,打开 Task Manager 看到 CPU 最高的一项永远是 Prerender: https://www.google.com/search/warmup.html, 搜了下或许关闭 Preload pages 有用,正在持续观察中

反正 token 用不完,Opus 5 + fast model 岂不是比 Fable 还爽?

猜我怎么判断是机翻?AI 特别喜欢给英文句子加分号,但没有活人在网上会这么干

虽然很理解这哥们的意思,也十分赞同他的观点,但这句话说得确实让人绷不住,直接引战了。说话的方式太重要了,同样的意思,换个说法就感觉不同,换个语言更是偏差巨大。本来是指责 HN 的讨论一说到中国的模型就开始扯政治对立、人权等等垃圾话,有一说一这确实是没
虽然很理解这哥们的意思,也十分赞同他的观点,但这句话说得确实让人绷不住,直接引战了。说话的方式太重要了,同样的意思,换个说法就感觉不同,换个语言更是偏差巨大。本来是指责 HN 的讨论一说到中国的模型就开始扯政治对立、人权等等垃圾话,有一说一这确实是没营养的讨论,以我对 HN 这两年言论环境的了解,已经有越来越多的人消除对中国的阴谋论滤镜了,所以这个事说清楚我认为是会有很多人赞同的。结果这发泄式吐槽加上机翻,直接让人觉得,好家伙你说人权是垃圾是吧,变成挑衅了,搞得本来很多说话比较理性的人也没法接受原本的观点了。实在是大型跨国交流翻车现场… https://news.ycombinator.com/item?id=48973549

这两天在主线工作上的进展给我带来了非常大的成就感。我发现语音输入法的效果,虽然原始转录结果已符合标准,但经过 LLM 润色后反而不尽如人意。我判断,问题出在模型与提示词的搭配上。但我并不擅长提示词工程,不想把自己的时间耗在慢慢改慢慢试的无尽深渊里。我
+1
这两天在主线工作上的进展给我带来了非常大的成就感。我发现语音输入法的效果,虽然原始转录结果已符合标准,但经过 LLM 润色后反而不尽如人意。我判断,问题出在模型与提示词的搭配上。但我并不擅长提示词工程,不想把自己的时间耗在慢慢改慢慢试的无尽深渊里。我寻思,应当把样本数据收集起来,建立一套标准化的评估和迭代体系。只有这样,才可能量化每次改动的效果,把模糊变为确定。 于是我把这个想法和 fable 沟通,让他帮我开发了一个 evaluation 系统(我告诉 fable 要做成 agent native,cli + api 调用,eat your own dogfood),并把我过往语音转录的 2000 多条音频都收集起来导入进去。随后,我从中挑选了几十条音频人工标注,建立了一个数据集。然后让 fable 基于现在的 prompt 自己开始迭代。让我惊喜的是,只一个上午的时间,达成率就从一开始的 33% 提高到 67%。当然,最让我高兴的是这套方法的行之有效。我发现,给 agent 一套方法和工具,给定评判的标准,它就能持续地循环、迭代,把结果变得越来越好。虽然这和真正的 LLM 训练不能比,但也让我侧面感受到「炼丹」的魅力,好家伙真的有点上瘾的。 现在我在做的,是把数据集细化,分短音频和长音频两种,用两套提示词针对性地迭代,这可以改进只用一个提示词泛用型强而针对性弱的缺点。再之后,准备把 STT 模型的评估也纳入进来,方便我选出最适合产品需求的语音转录模型。