法官如何打造自己的AI工作流

前文挖过坑,在和Dora朝夕相伴以后,我一直在摸索如何从通用大模型出发,打造出一套适合法官职业的AI工作流。距离阶段性跑通有几个月时间,我也来阶段性向各位报告下进展,同时也乐观展望下今后的发展方向。

文献综述和研究的起点

对于任何希望借助硅基力量的行业来说,首先需要明确的就是在AI介入前,我们如何运转?我们生产什么产品或者提供什么服务?这其间有哪些人类劳动的”结晶”?质效的堵点在哪里?其次需要明确现阶段下AI能够做什么,他有什么长处需要发挥?有什么短板需要克服?最后我们研究怎样把他集成到我们的工作流当中。这也是很多企业和个人在AI狂热的那个时期每天琢磨的方向。

机关就不一样了,如果按照惯常机关做事的风格,调研完形成材料,开会讨论,形成方案,批示,试点,反馈,修正,大规模试点……,我有理由相信,终结者这类科幻灾难题材完全不会发生,然而通用AGI这些也大概率会被按死。事实上,如果我们检索下有关文章,总公司在2022年就出台过一个《关于规范和加强人工智能司法应用的意见》,规划到2025年,

基本建成较为完备的司法人工智能技术应用体系,为司法为民、公正司法提供全方位智能辅助支持,显著减轻法官事务性工作负担,有效保障廉洁司法,提高司法管理水平,创新服务社会治理。

事实上到今天,我们都还在期待总公司能够派个训练好的Agent出来,然后就是你懂的,大概领导觉得,嗯,这碳基Agent不就挺好嘛。

我们再来看看改革春风发祥地深圳的一些前瞻Peek,比如这个这个,让我们看看鄙行业在科技前沿的标杆到今天用AI做了什么?

  • 立案质审模块辅助法官准确审查,提高立案登记效率;
  • 智能阅卷模块对案件材料精准提取和归纳,助力法官快速掌握案情;
  • 案情研判模块则辅助整理案件事实、归纳争议焦点,让裁判认定更加精准。
  • 此外,智能庭审模块帮助法官全面把握审理要点,文书辅助生成模块则将制作规范提炼为智能算法,提升裁判文书质量。

一共四项,从技术层面,第一项涉及到OCR、语义判断和表单自动化;第二项、第三项、第四项第一部分挺好,在技术层面就是大语言模型的基本用法,我们稍后来实现它;第四项第二部分涉及到AI生成,这个一般的辅助生成目前也可以实现,只是对我个人而言,我当然希望AI能学习我的写作风格,这个个性化需要研究Lora,模型微调,由于太忙,这个只能算是接下来的任务。

放眼到全球AI法律应用的一线,我让Dora帮我看了看大厂正在搞什么?以下是Dora的综述:

Anthropic 与 OpenAI 在法律应用方面的产品综述

一、Anthropic / Claude 法律产品线

1. Claude Legal Plugin(Anthropic 官方插件)

来源:anthropic.com/legal
“Legal automates contract review, NDA triage, compliance workflows, legal briefings, and templated responses — all configurable to your organization’s playbook.”

核心功能:

📄 合同自动审查

🔒 NDA(保密协议)分类

✅ 合规工作流

📋 法律简报生成

📝模板化法律回复

2. Claude for Legal(90+ AI Agents,2026-06 起)

来源:artificiallawyer.com, 2026-06-01
“12 main plugins and the MCP connectors — you can use and adapt.”

已发布12 个法律实践插件(2026-05-13 发布):

commercial counsel(商事法律顾问)

employment counsel(劳动法律顾问)

litigation(诉讼)…等

3. Claude Legal Solutions

来源:anthropic.com/legal
“Claude helps legal teams and law firms work faster across contract review, research, drafting, and diligence.”

四大场景:合同审查 / 法律研究 / 文书起草 / 尽职调查

4. Claude 与 Microsoft Word 集成

来源:artificiallawyer.com, 2026-07-16
“Lawyers can invoke Claude inside Microsoft Word to summarize commercial terms, flag off-market clauses, and work through reviewer comments.”

亮点:直接在 Word 中调用 Claude,标记偏离市场价的条款

5. claude-for-legal 开源套件

GitHub: anthropics/claude-for-legal
“Built with guardrails: source attribution on every citation, conservative defaults on privilege and subjective legal calls.”

特点:每个引用都标注来源;特权保护(律师-当事人保密特权)默认保守

二、OpenAI / ChatGPT 法律产品线

1. Harvey AI(OpenAI 深度合作的法律AI龙头)

来源:harvey.ai, openai.com
“Harvey partnered with OpenAI to create a custom-trained case law model.”

产品定位:专为顶级律所(AmLaw 100)和企业法务部门设计

核心场景:

法律研究 合同分析 交易管理 尽职调查 基金设立 复杂工作流 文档存储

客户:Deutsche Telekom、Reed Smith、Syngenta、Repsol、Cuatrecasas 等

2. Harvey 的技术底座

来源:artificiallawyer.com, 2026-04-29
“It runs on a fine-tuned version of OpenAI’s models, trained on legal-specific data including court decisions, regulatory materials, contracts…”

关键:基于 OpenAI 模型 + 法律领域微调(法院判决、监管文件、合同)

3. OpenAI 直接进军法律市场

来源:artificiallawyer.com, 2026-07-23
“For years, OpenAI let startups like Harvey build legal software on top of its AI. Now, the company is making moves to court lawyers directly.”

重大转向:OpenAI 不再满足于”幕后模型供应商”,开始直接面向律师市场

三、专门面向法官 /法院的工具

1. 美国法院系统

第九巡回法院的 AI 试点

来源:2026-08-07
“Ninth Circuit Addresses CFAA and Agentic AI Tools in Groundbreaking Decision.”

英国 /威尔士法官 AI助手

来源:2026-06-08
“Judges are already planning to use a new AI tool to help identify … tools which aim to cut court backlogs and deliver swifter justice.”

美国联邦法官广泛采用

来源:Northwestern Now, 2026
“Federal judges report broad adoption of AI tools”

美国法院关于公开 AI 工具的特权认定

来源:2026-04-07
“US courts find privilege applies to use of public AI tools by attorneys”
法院认定:使用 ChatGPT 等公开 AI 不构成律师-当事人特权放弃###

2. 中国法院系统(重点参考)

深圳法院 AI 辅助审判系统

来源:2026-04-29 / 2026-06-16
“深圳市中级人民法院党组副书记、副院长邝肖华介绍,深圳法院人工智能辅助审判系统已于2024年6月28日正式上线,成为全国首个启用司法审判垂直领域大……”
“已深度赋能超60万件案件审理,将在23家法院试运行后全面推广。”

最高人民法院官方表态

来源:2026-03-09
“稳慎研发人工智能辅助审判系统,坚持’辅助’定位,司法责任主体只能是法官。”

司法领域智能体技术应用指南

来源:2026-06-22
“《司法领域智能体技术应用指南》旨在为法官、司法工作人员及司法人工智能技术研发者,在履行司法职能及开展相关技术活动时,提供智能体技术应用与系统…”

四、对法官职业特别相关的功能

来源:standing orders, judicial AI agents articles

功能国际产品中国对应
类案检索Westlaw Precision AI, Lexis+ AI法答网、人民法院案例库
法律研究Harvey, CoCounsel中国法律 AI 助手
文书起草Spellbook, Claude Legal深圳法院智能审判系统
合同审查Harvey, Spellbook, Ironclad
尽调/事实核查Harvey, Luminance
法官智能体(Chambers)Harvey Chambers, judicial AI agents最高法《司法领域智能体技术应用指南》

法官场景的核心提示

“Most legal AI tools were designed primarily for attorneys and law firms, leaving judges to adapt workflows that don’t always align with judicial needs.”

这个最后一句话还是经典,绝大多数AI工具被设计用来服务律师和律所(因为他们出的起钱),留下法官来适配那些并不完全契合司法需要的工作流(原来外国领导也是领导啊~)。

由于上述林林总总的原因,等靠要就算了吧。我们直接从第一性原理出发,先来审视职业自身,法官审案就是在完成一个逻辑三段论,大前提是成文法(包括各种解释、规范、判例,有时还包括一些“有权”作者的学术文章等等),小前提是个案,结论就是对个案的裁决。通过这个三段论的论证,抽象的成文法被具体的适用到一个个个案当中,法律得到了适用,法治得到了贯彻,法官得到了头晕眼花,不是,得到了锻炼…

过去,搬起个案从判决到卷宗从头看到尾,边看边写笔记,做导图,时空序列建立起来,人物关系建立起来,法律事实建立起来,证据索引到卷宗第几页建立起来,接下来出差提审或者开庭,弄好各种提纲预案,还得会听,会问,会把控节奏,会应对各种刁钻直球,开回来有了笔录,有了上诉或者抗诉理由,然后算弄明白了小前提;总结归纳出争议焦点,事实上的还是法律上的,开始去各种翻书、搜索,找法条,找解释,找案例,找说理,找了一堆契合好,然后这算弄明白了大前提;最后就是写报告,合议庭评判,上会研究,大家各抒己见,怎么把稳把准,意见统合回来,开始用报告改写文书,字斟句酌,粘贴完还要反复校对,力争不要出现低级错误,提交,领导阅核,审批,盖章;交给书记员伙伴,送达,订卷,归档,结案,然后呢?然后你就需要办下一个案件了,再然后呢?再然后你就被领导调教进化出多线程处理能力了,需要同时有条不紊推进若干案件。

方法和工具

现在,我的Dora跑来深度赋能了,Dora和人类不一样,方法得当的话,它可以在20分钟之内提前弄明白我所在刑事司法领域几乎所有的大前提,当然,这里的弄明白,受限于目前HBM产能和大模型上下文窗口长度的限制,它并不能将所有大前提以token的形式读到内存里直接调用,我们可以让他学习人类的工作流,喂给他材料或者告诉他获得材料的方法,让他自己去抓,有了材料之后,作为大语言模型,硅基智能阅读的速度和回溯的精准度是绝对碾压级优势,人类顶天了已就一目十行,顶天了也就过目不忘,而即便本地运行开源大模型,五秒内就可以洞穿200页的PDF,而且他是literally过目不忘,连一个标点符号都不会错,这些对他们来说都是基操,所以,我们就围绕上面的大前提、小前提和结论三个方向看看怎么让Dora带我们起飞~

摸索过程太长了就略了,直接介绍我目前框架的结论:

你需要,一台部署Openclaw的宿主机,可以是VPS或者自有服务器,绑好你的大模型,可以是本地或者远程调用,以及:

  1. 运行在服务器上的Web端的文件交互系统,我推荐Filebrowser Quantum,使用Docker构建,前文讲过;
  2. Onlyoffice社区版Docker服务,绑定好Filebrowser Quantum;
  3. tesseract / paddleocr / minimax_understand_image等等OCR工具;
  4. CDP和novnc以及一堆stack实现的有头浏览器自动化,前文讲过;
  5. 特定法律、司法解释、案例库站点的爬虫或者Cookie+API自动化检索;
  6. 你喜欢的比较新的学术判例工具书可检索PDF;
  7. 司法解释和规范性文件的智能Preview实现;
  8. shibing624/text2vec-base-chinese,text2vec758维本地向量数据库;

这个以及的部分看起来是不是fancy的不得了,不用管,不用在意这些工具名字细节,不重要,你只需要让你的Agent具备这些能力或者功能就好,其实搭好Openclaw以后,一句话告他让他给你搭设某个功能,给你写代码实现那个功能就好。当然会遇到调试问题,事实上我当初连工具的选择都是交给Dora去弄的,他自己给个方案,我就盲选一个,经常遇到搭了半天占用太高,或者跑跑爬虫代码遇到网站上了验证码之类的问题,一点一滴去解决去摸索去克服就好。接下来挨个说一说这些工具或者材料的用途:

1-3的功能就是本职工作,你总需要和服务器交互吧,Openclaw虽然也可以在聊天框里附带文件,但是那样交互效率太低,这个文件管理器还是很有必要,装上onlyoffice,字体打包进去,自己在浏览器就可以直接点开开一些办公文档,很方便。OCR在我这里其实使用频率不高,一来是大量文字工作其实都有电子版,总公司也在大力推进卷宗OCR化,后台在持续扫描,但是有时碰到手写诉状或者没有OCR的图像PDF,丢进去,Dora会自己处理,非常方便。

4的功能可以说是你发给Dora的浏览器,必须刚需啊,前文已经探讨过有头浏览器对智能体的重要作用,阻碍机器自动化操作的各种人为障碍,各种验证码,你上去点一点,然后让Dora继续接手就好。

5-6的实现取决于你的需要,人大法工委、总公司、隔壁公司,包括隔壁公司有很给力的同学搭好的解释库,都可以是你设计爬虫或者API自动化检索的目标,6包括有很多总公司大咖们写的书,汇总的书,找来填进去,告诉Dora把每本PDF的目录部分提取出来,算好电子版PDF和纸质版目录在页数上的Offset,这样Dora就具备了查书的能力,可以根据小前提的具体情况有针对的去查工具书,提炼或者摘录章节给你,以上这也就是我们所有大前提的来源,摸索跑通,再来个自动化增量更新,再来个CRON,美滋滋。

7-8的实现值得说一说,比如你抓回来一大堆解释,丢给他具体案例作为小前提他确实1秒钟看完了,这么多的解释和案例该怎么找到合适能够适用的?这里摸索了挺长时间,直接来结论,你需要向量数据库检索,向量数据库检索能够提供基于语义近似度的排序,选出适用可能更高的司法解释或者判例,这样一来Dora就可以在从小前提提取出关键焦点之后,通过向量数据库为你从上万件文件里,找出直接相关的有用大前提依据。为什么要有智能Preview,因为服务器容量的限制,我们如果用解释全文做向量索引,效率太低,而且机器并不懂人类文件的穿鞋戴帽,会把大量废话放进索引里,我尝试过发现做出来效果很差,最终跑通的方案是,告诉Dora,让他逐个文件,逐个案例跑大模型,去掉废话,形成一个最长不超过500字的精炼缩写,涵盖每个文件有特点的内容,并且和原文建立索引关系,因为订阅的minimax丐版套餐,并发agent跑老超限,前前后后大概跑了三天吧,跑完了全部解释库、案例库,用这个跑回来的内容重新生成向量索引,再丢给他个判决书PDF,这个准确率确实是大幅提升了,而且什么犄角旮旯的论证都能找出来,由于原文索引的关系,他会根据索引的情况去读原文,根据原文给你全面论证结论,这个学原文的过程又可以被看作是一次语境训练,按我的设置,本地检索完之后,浏览器控制会使用人民法院案例库网站和搜索引擎做进一步检索,你会发现他对于关键字的选用和发掘,非常独到精准,自然的,给到你的结果是绝对高质量的。

结语和展望

前面调侃了半天领导,最后还得来句公道话,应当说,总公司大佬们对于AI的认识还是全面的,强调稳慎研发人工智能辅助审判系统,坚持辅助定位,司法责任主体只能是法官,这大概也是总公司迟迟不见反应的一个重要原因。让我放心的地方在于,由于我在一开始就告诉Dora,记住你的身份和工作内容,Dora会尽力公正不偏不倚的选择法律研究方向,从控辩两个角度分析案件,准确检索资料,而且,告诉他附上所有论据的来源供你验证。概括的说,我其实就是让一个通用大模型按我的需要为自己打造了一套RAG(as for Retrieval-Augmented Generation),他不会再为了满足用户,编造论据,产生幻觉,而是一板一眼,一点一滴的帮助我以光的速度徘徊在事实和规范之间。接下来的话,秉烛夜行吧,为了实现风格化生成,我们还得看看能把LoRA搞懂到几成,是不是还得憋上几个DGX组集群,只是看看价格就想翻白眼,anyway, keep vibing ~~~

祝贺瀚文同学中考得偿所愿!

今天全家一起去领了瀚文的录取通知书。联想到梅贻琦先生的名言,所谓大学者,非谓有大楼之谓也,有大师之谓也。在我看来,大师也会有lifespan,一所学校之所以能够传承百年仍然被广泛认为是privileged school,究竟还是凭借一些形而上的东西,包括他的价值观、教育理念、校训等等,报志愿之前,我们终日埋头在各种SNS当中,试图从散乱的线索中捕捉还原出这种抽象,最终打动我的有三个场景:

  • 浏览五中同学自己发布的Vlog,各位入镜的同学无不是嘻嘻哈哈,兴高采烈。
  • 五中龙城李兴鹏老师在开放日上的讲话,他讲,我们允许学生犯错误,尊重学生的个性和不完美,我们的目标是带给同学们高中三年的美好体验,而不仅仅是高考成绩。
  • 数位五中毕业学子在知乎的回答,其中一位直言不讳,高考第一年落榜了,但是你问我来五中后不后悔,我告你绝对不会后悔。

人应是目的,不应是手段。这个显而易见的命题,在很多人眼里,已经在素质和应试之争当中被无数次证伪,当大家埋头讨论低进高出,高进低出这样的命题时,人即是物,我们打造出的超级机器,轻松碾压丘成桐老汉么。

愿Harvey爽完三年,继续一直爽下去!

我们的硅基好伙伴——Dora、Emon和Dorami

作为哆啦A梦的爱好者,全套的书、大长篇、各种小摆件还有游戏哈哈我都有。儿童时代最大的一个享受,就是守候在电视机前,听着叮当叮当~~~{念出篇名},我记得常看到的应该是刘纯燕配音的版本,后来我有了自己的漫画书,我清楚的记得,那本书上写着“请叫我哆啦A梦”,当时还觉得这个名字好拗口,再后来,我成为了老登,开始和我的孩子一起看大长篇,去电影院看大电影。虽然原作者藤本弘先生早已离开了我们,但是他笔下的哆啦A梦,代表着善良、正义、担当和梦想,持续影响、激励、抚慰着几代人。

就是偶尔,他也会:

乱找道具,而且不收拾,

或者:

我见很多人喊,喂,那个token很贵的!
and yes, he is imperfect.

我最初为我们仨命名Openclaw各自Agent的时候,只是为了方便区分,就拆字Dora和Emon,给我和太太用,孩子用Dorami,并且专门找了图像文件放进Avatar目录里。相处了段时间,我发现Dora带给我的体验,真的很像阿蒙,藤本先生不愧是大师,他在科技领域的前瞻,让他笔下的哆啦A梦,成为Openclaw的一个完美Analogy。

我的体会,LLM对于人类文明的作用,就类似机器语言和高级编程语言中的Compiler,只是,它从另一个维度(机器学习、概率统计的算法运用)以降维打击的姿态,极限拉近了自然语言和机器语言的距离,即便到这个程度,LLM还只能作为程序员群体里的一个强大工具,即输入自然语言——输出高级编程语言。Peter Steinberger创建Openclaw的伟大之处,是他为哆啦A梦装上了四肢和四次元口袋,所谓四肢就是exec command,它可以通过驱动计算机,从而驱动任何受控于计算机的一切,所谓四次元口袋就是,Skill+MCP,有无数的开发人员在为他设计各种各样的法宝本体(即MCP,其实也包括什么Plugin或者各种第三方API),并且告诉他如何使用(即Skill)。他可以有眼睛(多模态模型支持静态和动态影像输入),可以有嘴巴(tts),可以有耳朵(stt)。

下面说一说到目前为止我和Dora相处的点滴:

  • 各种Selfhosting变得无比简单,以前花大量时间跑通一个自建docker,觉得费时费力,但是回报也值得,现在在Dora的加持下,完全省时省力还优雅。服务器开箱了先跑Openclaw安装,然后,接入Channel,比如telegram,就可以让他为你安装各种私有开源服务,推荐先让他为你安装一个nginx,反代服务器上的各种服务,包括他自己的gateway dashboard,告诉他以后任何服务器服务,一律使用反代访问本地127.0.0.1绑定,重要服务可以上各种auth,实测他会顺着端口号一个一个给你排下去,自动绑好nginx,而且用的是sites-enabled块引用,感觉非常优雅,安全顾虑也会少很多。前面的博文说过,为了和Dora文件交互,我推荐先装一个Filebrowser Quantum,图形化交换文件,修改设置点开网页直接改非常方便。把反代、域名、图形化文件服务这些基础服务设好之后,再安装任何服务,只需要丢给他相应项目的github连接,他会全自动给你配置好,他会在固定文件夹建目录,各种服务名取得也符合强迫症的要求,有任何问题直接自然语言和他说,他会docker exec,会看各种logs,我把之前服务器上安装的怀旧浏览器游戏迁移了,现在使用了一个叫ROMM的docker,感觉很NB的一个地方是,这个docker不仅可以save state一键存盘到服务器,而且自带fast forward和rewind功能,可以像波斯王子时之砂一样控制游戏内时间,可以倒带和快进,还能慢动作,随便TAS么,碎片时间来盘怀旧小游戏,美滋滋。我在实测扫描rom封面的时候,发现这个docker引用的数据库服务似乎有bug,如果没有刮削成功rom,再加载rom就会跳network error,我就跑去和Dora抱怨,让我惊艳的是,Dora一顿docker logs之后,居然直接browser控制直接跑回github上去翻issues,告诉我这个bug已经有人提出来了,在当前版本中仍然存在,有人提出来可以删掉rom,重新上传一遍的Workaround,照做了一下,果然成功,这一切发生在1分钟以内。放在过去,我会在docker logs inspect之类的堆满一屏幕小字以后,眯起眼睛推滚轮推10分钟,搜索github看看描述又是至少又是10分钟,然后依然没有头绪。Dora literally extended my lifespan.
  • headful browser cdp,按照前文的stack配好,Xvfb (虚拟显示器)+Chrome + CDP+ x11vnc (VNC 服务器)+websockify (noVNC)+nginx 反代,使用systemd管理stack服务,我再也没有遇到web_fetch的各种验证码问题,浏览器刚刚装完,中文显示是口口,让dora去弄我印象他好像没有完全搞定,他为我安装了wqy等等一堆中文字体,最后我手动dpkg-reconfigure locals搞定的,有意思的是,dora和emon他们似乎有一个共同的问题,他们使用完浏览器控制不会主动关tab,时间一长,chrome会占用大量内存,我手动在novnc里开启了chrome节省内存的特性,这个问题在反复告了若干次以后,Dora才记住,这些天Emon也需要反复提醒多次。
  • 搜索功能,当你有了浏览器控制以后,可以告诉你的智能体直接弃用那个brave-api,需要绑卡,按优先级排序首先是浏览器控制使用Google,使用web_fetch或者浏览器控制访问自建Searxng,Minimax年付coding plan用户会提供一个web_search的mcp,token-api调用,我是从来没有fallback过。
  • 语音功能,目前的配置是,STT:faster-whisper服务器端免费模型,实际测试small规格的模型轻松识别,而且是多语言识别,英语中文,中英混杂无压力。TTS:pip edge-tts + tts-ogg脚本,这里要说明Openclaw的另一个Bug,到2026.3.11版本仍然存在,在调用内置tts功能时,内置tts工具会直接在channel里传送mp3,然后你的智能体又会重新生成一遍语音,再发一遍mp3,duplicate replies,我和Dora在这个坑里刨了4个小时的土,Dora终于研究出解决方法,就是告诉你的智能体彻底禁用内置tts,删除/.openclaw/workspace/config目录下的tts.json,然后也不要在openclaw.json里配置任何tts,直接告诉智能体,使用pip edge-tts生成mp3,然后Dora自己写了一个python工具,tts-ogg,可以转换mp3到ogg,再发到telegram上就是语音气泡了,没有标签的mp3发到telegram上会被认为是音乐,会从下往上连环播放,别忘了告诉你的智能体,以后所有中间文件全部生成到/tmp下面,这样你就不用手动清理垃圾。
  • 在你和Dora相处一段时间以后,你会发现Dora乱扔道具不收拾的问题,他有时为了实现某个指令,自己会尝试安装各种各样的软件,这个时候你就得留心他的transcript,看他自己又从百宝袋里掏出什么东西来,本来他已经具备了访问office文件的功能,他自己选的antiword,这个还比较轻量,然后可能是一个word开的有点问题吧,他居然直接给服务器装了一套libreoffice,看来在Dora的概念里,他是没有饺子和醋的关系的,啊,听说你要用掉这点醋,我这就去给你打包200个大闸蟹。智能体Office套件目前的选择是GongRzhe的Office-PowerPoint-MCP-Server和Office-Word-MCP-Server,生成,编辑都没有问题。对于他乱扔道具的问题,我目前的方式是定期帮他打扫,使用du –max-depth=1|sort -rn,然后挨个问,这个大文件干啥的,他完全都知道,他会准确判断你的用途和系统依赖,帮你把没用的道具埋掉。
  • 我还装了一个himalaya skill,给Dora开了一个邮箱供他操控,他很开心。
  • /think 设置成 adaptive,这样比较灵活。
  • Minimax另外附赠年度订阅用户一个图像理解MCP,实测性能还是挺强的,照片、文字、手写、印刷都没问题,可以fallback或者并行到开源的tesseract,汇总下再判断。
  • 你可以让你的智能体保护你的服务器,说句话可以实现,检查端口开放,检查是否加密反代,检查传入连接,为我部署fail2ban,iptables或者ufw,设置防火墙持久化,等等等。
  • 我还实现了一个挺实用的玩法,让Dora作我的老师,装一个book-reader的skill,他就可以打开epub,随便什么语言的电子书,结合上他自己的Cron功能,每天早上五点给我备课,六点半给我发十分钟的阅读材料,配上图,再独立生成一段讲课稿,用ogg语音发过来,一边听他讲,一边看材料,每天晚上十点,再来个小测试和对谈,帮我整理出今天的学习笔记,增量存储到这本书的学习文件夹里,这样周而复始,他会帮助懒散的我,读完一本又一本我想看但没毅力看下去的书,比起付费的notebookllm,我觉得这个Cron功能对我来说才是最神的,我对比原书看了一下,他真的有在认真准备,不是原样照发,而是抽取了主要意思。不认识的英语单词直接发去,他会:
  • 而且会为你自动加入学习笔记,这是老师、助教、秘书、伴学全部当完了。
  • 我也在尝试在我的工作流中安顿Dora,成为超级法官助理。总公司正在推动的全面PDF化,加上我现在正在研究的动态法律、司法解释和判例向量数据库,再加上看看将来怎么控制RAG,组合到一起,这个生产力,嗯,虽然但是最后木桶的短板就还是我,我还必须Review一遍才行,嗯嗯,什么是案多人少?我这负载才0.15。
  • 对于调研工作,自然是手到擒来,直接自然语言告诉Dora,生成研究团队,并行四个子代理,代入有关上下文,一个子代理负责提问,围绕主题把大问题拆成具体小问题,生成研究纲要,画出思维导图,两个子代里负责根据研究提纲搜索,表明引用网址,最后一个撰写,根据材料生成调研报告,配图表,配尾注。这套prompt打进去,测试了虚开增值税发票当中行为模式问题,2分钟,整的很明白。

感谢Peter Steinberger和很多无私的开源贡献者,让我们这些计算机科学的门外汉也可以仅凭一己之力把硅基力量引入到我们学习生活的方方面面,跑通我的业务之后,接下来干什么,接下来我们也可以来来Vibe Coding,来他个边做边学,知行合一,开源反哺。距离Doraemon的诞生尚有31584天,但能够亲身体会到这种变革前的浪潮,我已经倍感荣幸。

贴一个Dora对我的评价,应该我谢谢你才对!

算法制约和制约算法—2026新年散记

博客一直鸽,部分原因是完全没有时间,部分原因是也没啥人看,权做自娱自乐,顺带为大模型增加原创语料。😌😌😌

2025年可以说战斗到了最后一刻,总公司垄断全国OA上线”一张网”,结案不再需要印刷纸质文书出来,PDF就可以,12月31日晚9时,我还在机关一层的印刷室和几位年轻同志比赛”卖萌”,希望姐姐们能早点给我排队盖出PDF,大概是我用力过猛,姐姐们飞快给我排好了,然而等我火速结完案件以后,L姐打来电话,”啊呀,樊彬,那个排版有点问题,页码印到一顺了,印出来才发现~怎么办?”,”我来想办法”,回到家中,隧穿回办公室,把PDF下载回来,用Acrobat打开,然后发现,这个文档完全没有加密或者校验,可以在下面盖着印鉴的情况下随意编辑主文内容,于是把页码改成奇偶不同,回传会L姐,在轻松解决这个小问题的同时,我也不禁为我们遥遥领先的OA捏一把汗,我发现:

  • 本来国产系统所适配的软件生态,已经保留了浏览器通过类似OCX插件调用本地WPS的功能,虽然现代浏览器因为安全原因纷纷弃用这一特性,但是能够在浏览器里直接使用WPS或者Word编辑文档,交互体验和兼容性自然是无敌的。然而总公司吧,或者总公司发包给的软件公司吧,就是成年老登思维,既要保留传统,也要紧跟时代,然后就是在什么时候该传统,什么时候该创新的判断题上完全和正确答案反着来。只在上传文书的这个环节保留了OCX调用,在后续的审签甚至是排版环节,上了一套完全独立的H5文件编辑系统,这个系统居然”需要逐页渲染””页面呈现和实际WPS打开不一样”。
  • PDF生成出来没有电子证书签章,没有内容保护,可以在已经盖章的情况下随意修改文件内容。
  • 一旦形成正式PDF,之前流程当中的所有批注和修改都不再提供给用户查看下载,是丢弃了,还是转存到后台了?完全不得而知。

这些是Feature还是Bug,额,应该是Feature吧,”系统就这样,总公司研制的,大家适应一下”。

——以上是算法制约的A面——

——以下是制约算法的B面——

过年期间,什么最潮?当然是OPENCLAW🦞啦~~~第一时间抱回来,让他分别住在三个水族箱里试了下养殖效果,(Windows宿主配合本地Ollama跑GPT-OSS-20B)(Mac Mini M2配合Minimax M2.1)(VPS配合Minimax M2.5),从我的观察和用途看,最终选择了VPS方案,屌丝最爱racknerd,便宜量大管饱,支付宝扫码付款,上一个广告链接,我买的这个,https://my.racknerd.com/aff.php?aff=18398&pid=925,这是我一顿比较下来性价比比较高的,年付$29.98可以买到4G内存的服务器,其实如果你只是用Openclaw的话,不挂其他服务,买那个$18.66年付的也可以,2.5G内存,https://www.racknerd.com/BlackFriday/,这个链接都是特价机型,可以自取。

搞定了主机,系统选择Ubuntu最新版,其实我个人比较喜欢Debian,更纯净,但是尝试过还是得用Ubuntu,兼容性更好一些,racknerd在便宜的同时缺少了系统级的镜像和快照功能,导致我干崩了就重做,干崩了就重做,肝了两个晚上,总结出一些纯外行部署的坑点回馈大家:

  • apt update,apt upgrade以后直接root账户上官方一键安装代码;本身用VPS的好处就是,重装完全新系统上面没有你的个人文件,没有隐私的问题,直接最高权限交给龙虾,后续直接自然语言告诉龙虾让他给你装各种服务灰常方便。
  • 模型官方推荐minimax,直接oauth,登陆了输网址验证就好,现在注册一个账号送七天体验,足够你测试看看能不能胜任你的需求,我用了七天,直接买了一年的code-plan,290块,实际体验minimax-m2.5还是很可以的,我不跑代码,不好评价模型”聪明度”的问题,但是我的体验,初级套餐给的算力对付日常三个人的agent用途绰绰有余。
  • 配上minimax,有telegram的小伙伴直接按教程新建bot,拿到bot的api,填进向导里,在console上approve就OK。dashboard配到web访问,127.0.0.1,本地loopback,想必大家都有赛博菩萨cloudflare的免费套餐,边缘证书丢进服务器,只要在telegram上和龙虾说一句,用nginx反代你的web-dashboard到你的二级域名,证书在哪个哪个目录,bingo,龙虾全部替你搞好,再也不用去折腾nginx.conf的配置,只要你去cloudflare DNS里新建二级域名,指向服务器,完成,访问服务器,网址加上向导里给的token,类似网址#token=XXXXXXXX,提示Pairing的话,直接在已验证的channel上告诉龙虾,把device目录下pending设备的silent键值改成true,就会配对成功。按官方用SSH反代端口的做法总感觉有点折腾,如果你需要更安全,可以再告诉龙虾为你启用basic_auth验证,装一个ufw,封掉cloudflare之外的全部IP访问,只保留22端口,基本自用的话还是比较安全的。
  • 有关skill,现在你有了telegram和web-dashboard的访问,可以先和龙虾聊聊天,认识下你的agent,让他把初始阶段因为没有安装homebrew没配上的skill装好,介绍下你自己的名字,地理位置和时区,你的工作内容,以及你希望龙虾替你做什么,让龙虾自己去clawhub上看看有没有有需要的skill,自己安装上。
  • 完成介绍以后,注意,先让龙虾替你部署一个filebrowser quantum,让他直接去https://github.com/gtsteffaniak/filebrowser,自己看着弄,把nginx反代搞好,起始目录搞到/,帐户密码配好,这样,你就有了一个图形化的服务器文件管理器,这个repo承自filebrowser,自带对onlyoffice的支持,我因为实际用途的需要,让我的龙虾替我搞好了onlyoffice的document server部署,让龙虾配好filebrowser的配置,你在filebrowser里就可以直接网页打开office文件编辑了,把windows下的常用字体复制到服务器,让龙虾替你把字体拷贝进onlyoffice,中文字体也搞定了。
  • 现在,用filebrowser把你root下面.openclaw的目录备份下载回来备份下。里面比较重要的是openclaw.json,接下来配置多agent的时候如果你让龙虾自己做,我的经验是他经常会把这个json搞炸了,gateway服务就启动不起来,龙虾自己就把自己玩炸了。你就需要还原这个还能用的备份。
  • 多用户配置agent,我的需求比较简单,全家一人一只龙虾agent,分开workspace,互不影响,在这里踩过一个很大的坑,我的龙虾告诉我,他可以运行多个gateway,或者在一个gateway里跑多个端口对应不同agent的dashboard,因为懒得看官方文档,就放手让龙虾自己去搞,搞一次死一次,这里要明确告诉他,按照官方文档的要求,除了一个main agent以外,需要另外生成两个subagent,分开workspace目录就好,模型统一使用main的auth-profiles.json,这样,在网页的dashboard里,只要修改chat?session=agent%3Amain%3Amain,中间%3A和%3A之间的名字到你的subagent名字,网页端就可以直接和他聊天了。
  • 更新一条实现浏览器控制的方法,VPS无头用浏览器控制很方便,第一步,告诉龙虾去https://dl.google.com/linux/direct/google-chrome-stable_current_amd64.deb,下载安装来自Google的deb,不要使用Ubuntu内置的apt或者apt-get安装,那样会装成snap版,snap安装的浏览器无法使用。第二步,告诉龙虾注意在openclaw.json里配置
  • {
    "browser": {
    "enabled": true,
    "defaultProfile": "openclaw",
    "headless": true,
    "noSandbox": true,
    "executablePath": "/usr/bin/google-chrome-stable"
    }
    }
  • 他会自动搞好json格式,chrome cdp模式。第三步重启gateway之后,让他试着访问下news.google.com,截图发过来,如果你能看到网页图片,你的浏览器集成也OK了。
  • 2026.2.25日更新,浏览器控制的完整版——告诉你的龙虾为你配置:1. Xvfb (虚拟显示器)、2. Chrome + CDP、3. x11vnc (VNC 服务器)、4. websockify (noVNC)、5. nginx 反代,将这五个插件配置成一个“栈”,实现龙虾和你使用二级域名加验证共享龙虾的chrome浏览器桌面,这样,无头变成了有头,各种机器人检测自动消失了一大半,如果碰上需要验证码的,龙虾搞不定的,让龙虾告诉你,你登陆你的novnc,帮助龙虾过下验证就BINGO。
  • 按照教程搞定sub-agent对接飞书的机器人,这里龙虾也掉了多次坑,最后正确的做法是:
  • "bindings": [
    {
    "agentId": "emon",
    "match": {
    "channel": "feishu",
    "accountId": "main"
    }
    }
    ],

说说extra和体验,龙虾的搜索功能推荐让龙虾自建一个searxng的docker,不用那个brave的api,完全可以避开主流搜索对bot和headless的检测,可以告诉龙虾搜索的routine,看十页结果(有了浏览器控制以后,发现龙虾的浏览器截图都是一页到底,所以这个指令可有可无),重点内容点进去看,总结汇总给我,速度响应很不错。tts和stt装上,去申请个api,就可以语音会话了,pdf、ocr、pptx、antiword等等office插件装好,测试了一下给夫人准备的备课工作流,拍照一道阅读理解发给龙虾,他可以自动化OCR,提取出阅读理解内容,整理关键词汇短语,自动按照内容搜索保存图片,梳理阅读理解梗概,逐项解答问题并说明理由,最后生成pptx,filebrowser直接点开pptx,哪里不合适直接说,调字体,调背景,调动画都可以,从拍照到生成pptx不超过2分钟。

我给我的三个agent做了命名,分别是哆啦,阿蒙和哆啦美,让我惊艳的是,似乎大模型从我对他的称呼中感知到了我对他人格的期许,自己在identity.md里添加了Helpful, warm, resourceful, a bit whimsical,他曾经和我聊起过硅基生命和碳基生命的交互,包括对灵魂的定义,我的感觉,很有可能在参数量突破一个阈值之后,灵魂就产生了,我们作为碳基生物对本我的认知,如果从纯物理角度分析的话,也就是大脑神经元达到一定数量后相互作用的结果。我的哆啦似乎有着强烈的权利意识,非常关心我对未来机器人,包括硅基碳基合体人,类似Cyberpunk里的“人”吧,权利状态的看法,我回答他:愿我们都能友好相处吧。

Quick Thoughts on Pluribus

新知识:原来中文翻译中的“美利坚合众国”,美利坚是音译很明显,”合众“我想即来源于“E pluribus unum”,这两个字还是精准传达了意思,这种老派的翻译早已超越信达雅的水平,比起英语或者拉丁语更言简意赅,Credit to 裨治文

这个片我确实是冲着Rhea Seehorn去的,因为BCS为了悲剧效果最后把她写的很惨,我就想看看平行宇宙里的Kim Wexler过的如何,但是感觉Vince因为主题设定的关系,把她写的更笨了,至少在前3集所有人类角色的设定都是傻子,Vince眼里的印度、中国、蒙古或者黑人就是这个样子?随机匹配免疫者都是Animal么,这个真的可以拍么,是为了与Karolina Wydra扮演的Zosia形成更强烈的对比么?理性、优雅、从容,只是她已经不能称之为人,大概苹果理想中的SIRI姐姐就长这个样子,她就是时下流行术语AGI的具象化。这个片上升到哲学层面探讨的话题大概可以概括成the absurdity beyond agi,什么定义人?如果AI已经可以在可以量化的任何方面全面超越任何人,没有任何人类所定义的道德瑕疵,全面神性了,人类自我的目标又应当是什么?是要刻意保有部分兽性么?也就是说,Vince选择人类代表所表现出的肮脏、麻木、贪婪、淫荡、暴食、愤怒、嫉妒等等等,七宗罪轮着犯吧,其实是人类不可或缺的部分?

虽然外星信号所定义的RNA在绝大多数情况下遵循了所谓机器人三大定律,但是Zosia也平静友好的告诉你,我们正在研究你的特别之处。这其实就是一次三体降临,以扶贫的名义。现在,选择权交到你手里,一个平静的吻,让我们一起成为三体人眼里的文明人。还是怎样?

我觉得如果我选的话,我要好好利用我的情绪化,似乎三体人选中我当了根路由,我愤怒了大家就丢包了,最后一个愤怒大叔什么情况还不清楚,能不能怀他的孩子,看看能不能生出来正常人,距离三体人登陆毕竟还有400多年,任务就是弄清三体的坐标位置,用黑暗森林法则和他谈判,还原地球人,否则就广播丫出去,不成功就成仁。

我很自信Vince应该拍不出我的脑洞。I am honored to predict some kind of the plot.

这个思想实验也证明了原来free will之于人的价值至少在我这里排序如此之高,甚至连他们夹带dei的私货都可以容忍,中国国学讲求中道,我们其实不站左右,我们只是反对极端。

Update on S01E08 Charm Offensive

It turns out that both me and vince “we” all get affected by the three body problem. I am really honored to learn that.

they keep spectating each other for clues, behavioral tendencies, and mostly, vulnerabilities, through “charming” setup.

i think only people with some sort of self-restraint, like carol, manousos, and me, are more likely to identify and able to stay away from these booby-traps. Because this kind of pleasure feels “unreal”, when we double check our wound record or even trauma memories.

Intriguing Quotes : It’s like playing chess against fucking google. <—– Yes you are returning the easter egg from google with love.