跳到正文
三板斧 · 之三

算法差一点点就报废的活,
我们专挑这种干

这是最残酷的一步,也是市面上 90% 的同行倒下的地方:前面聊得再好,准确率到不了 95,全白干。三个专业团队接力一年停在 60 分的政府填报,我们 3 天做到 98 分——客户拿我们没见过的新数据现场盲测。凭的不是运气,是下面这些取舍。

60 分的 AI 是玩具,95 分以上才是生产力。

60 分不是「差一点」,是「完全不能用」——人还得全部复核一遍,核对的成本快赶上自己干。差的那一点点,就是「每天在用」和「吃灰落灰」的区别。

技术判断 · 一

别再用工作流做 Agent 了——那是上一代的思想

为什么工作流必输

「精度要求高,是不是该用工作流编排?」——这个前提就是反的。真实业务里,图纸看不清要放大局部、确认后再切图、切完回头核对,没有一步是能事先规定的。写两百个节点,也覆盖不了真实数据的千变万化。

当初那家 RPA 厂商敢承诺 60% 的前提,是「格式永远不变、网站永远不更新」——不是他们不努力,是那条技术路线的天花板。

我们用什么

底层是一个行动力极强的 coding agent,配三样东西:执行手段(能写能跑的代码)、工具(比如把 CAD 转成图像,让 AI 先用视觉看懂再动手)、经验(从这家企业萃取出来的判断逻辑,人能读懂的文字)。配好之后,剩下的让它自己决定。

精度不是靠捆住 AI 的手脚解决的,是靠校验和审核解决的。手艺在于:让它自由发挥,又不许它乱来。

知识库同理:不是地基,任务才是。第一个问题永远不是「我们有哪些知识」,而是「AI 要替我们做哪件事」——先有任务,才有知识。

我们自己踩的坑

那个 98%,我们连错了四次才站住

纯规则正则解析,PDF 版式千变万化,连错四次;让大模型直接算数,幻觉防不住。最后站住的是三条铁律:

01

大模型只做语义判断

绝不让它做算术。

02

算术全部交给代码

确定性的部分,用确定性的手段。

03

双跑对比 + 回查原文

每个抽取值都要能跳回它在原始文档里的那一页,防幻觉。

AI 落地的最后一公里不是准确率,是可追责。

数字不能溯源,业务就不敢拿去用;不敢用,系统就上不了线。所以审核不做在别处,直接做进真实的工作界面里。

上线前后,各设关卡

三道关:自查、对抗、复盘

「准确率高」是句空话,扛不住追问。我们把「怎么保证不出错」做成了三道明确的关卡——每一道都是产品的一部分,不是口头承诺。

自查

AI 每出一个结果,再单独写一段校验代码,回原始文档把来源撞一次。撞不上的,不硬猜——标出来交给人。

对抗

上线前留一套系统从没见过的考卷,让另一个 AI 拿着标准答案当裁判,把任务从头重做一遍、逐项对答案。自己人挑不出的毛病,对手挑得出。

复盘

人纠的每一个错——错在哪、应该是什么——结构化存档,定期萃取成新经验。审过一次的错,永远不再犯。

还有一条纪律贯穿三关:宁可交人,绝不硬猜。系统没把握的每一条,进「漏网表」如实交人裁决——数字员工先学会的不是能干,是如实汇报。

验收标准也不用「准确率高」这种虚词,用你行业自己的标准:财务的验收是可入账、过得了审计;环保的验收是敢报给政府;物流的验收是商务敢直接发给客户。做到你行业的专业级,才算数。

评测驱动

审核即评测:人每纠一次错,系统就进化一次

交付的不是一次性软件,是一个越用越聪明的数字员工。有个必须守住的分寸:不能来一个错误就改一次代码——那样改,模型的灵活性就被改没了。整件事一直在两个方向上找平衡。

1 机器自检

AI 每出一个结果,为它单独写一段代码,回原始文档把来源再撞一次。

2 人工审核

每个数字点一下,直接跳回它来自哪份文档的哪一页。审核和干活在同一个界面完成。

3 错误结构化

人审核发现的每个错误——错在哪、应该是什么——结构化存进后台。

4 经验萃取

攒够 case,让 agent 抽象错误、更新经验。审过一次的错,永远不再犯。

人走了,判断力留在公司。老师傅会退休,AI 学到的经验不会走。

这手纪律从哪来

差一点就是人命的场景里,练出来的精度纪律

创始人 9 年 AI 一线:小米对标特斯拉的自动驾驶数据闭环与算法产品、8 年 AI 评测与数据体系、真格基金黑客松获奖的大模型评测平台。ExcelMaster 在海外与全球最强的 Agent 团队同台竞争,10000+ 用户每天在用。认识一下这个团队 →

我只不过是把今天 AI 的上限摸到了给你看。别人给你做不好,是因为他们的水平不够。

—— 98 分测出来那天,我们对客户老板说的话

顺手送你一套供应商检验法

不管最后找不找我们,挑 AI 供应商时,这三条都能帮你省下几十万学费。

01

问他的 Agent 架构

答案若是「工作流编排」「可视化流程画布」「多 agent 编排」——大概率是上一代的东西套了新名字。答案若围绕 Agent 加自检加审核加评测展开,你大概率遇到了跟得上这一代的人。

02

看这家公司的老板

老板自己对 AI 有认知吗?有不少上百人规模的软件公司,老板连最前沿的 AI 编程工具是什么都不知道。自己都没搞明白这一代 AI 的老板,怎么带团队给你交付这一代的东西?

03

看人数和协作方式

动辄几百号人,前端等后端、后端等接口——人员冗余在今天不再是实力的证明,是效率低下的证明。找上一代的组织做这一代的业务,等于找恐龙给你服务。

效果好才是最重要的。效果不好,一切白搭。

怎么开始

有个准确率始终上不去的项目?拿来考我们

为什么敢不收钱?因为我们对自己的方法和实力有绝对的信心。东西做出来之前,我们担心你不签约;做出来以后,是你担心我们不签约。

01

免费诊断 免费

1 天驻场,从老板聊到一线员工,给你一张「AI 机会地图」。

02

免费 POC 免费

2~3 天,用你的真实数据做出能跑的系统。题目你出,现场盲测——效果亲眼看到,再决定给不给钱。

03

按结果签约

项目费保底 + 效果挂钩。我们和你一起对结果负责。

04

全年陪跑

每次人工审核都沉淀成 AI 的学习材料,系统越用越聪明。

手里有做失败的 AI 项目?拿来考我们。

我们最好的几个客户,都是这么开始的。多个客户验收后的第一反应,是主动提出「我帮你介绍给同行」——我们最好的销售,是客户本人。