算法差一点点就报废的活,
我们专挑这种干
这是最残酷的一步,也是市面上 90% 的同行倒下的地方:前面聊得再好,准确率到不了 95,全白干。三个专业团队接力一年停在 60 分的政府填报,我们 3 天做到 98 分——客户拿我们没见过的新数据现场盲测。凭的不是运气,是下面这些取舍。
60 分的 AI 是玩具,95 分以上才是生产力。
60 分不是「差一点」,是「完全不能用」——人还得全部复核一遍,核对的成本快赶上自己干。差的那一点点,就是「每天在用」和「吃灰落灰」的区别。
别再用工作流做 Agent 了——那是上一代的思想
为什么工作流必输
「精度要求高,是不是该用工作流编排?」——这个前提就是反的。真实业务里,图纸看不清要放大局部、确认后再切图、切完回头核对,没有一步是能事先规定的。写两百个节点,也覆盖不了真实数据的千变万化。
当初那家 RPA 厂商敢承诺 60% 的前提,是「格式永远不变、网站永远不更新」——不是他们不努力,是那条技术路线的天花板。
我们用什么
底层是一个行动力极强的 coding agent,配三样东西:执行手段(能写能跑的代码)、工具(比如把 CAD 转成图像,让 AI 先用视觉看懂再动手)、经验(从这家企业萃取出来的判断逻辑,人能读懂的文字)。配好之后,剩下的让它自己决定。
精度不是靠捆住 AI 的手脚解决的,是靠校验和审核解决的。手艺在于:让它自由发挥,又不许它乱来。
知识库同理:不是地基,任务才是。第一个问题永远不是「我们有哪些知识」,而是「AI 要替我们做哪件事」——先有任务,才有知识。
那个 98%,我们连错了四次才站住
纯规则正则解析,PDF 版式千变万化,连错四次;让大模型直接算数,幻觉防不住。最后站住的是三条铁律:
大模型只做语义判断
绝不让它做算术。
算术全部交给代码
确定性的部分,用确定性的手段。
双跑对比 + 回查原文
每个抽取值都要能跳回它在原始文档里的那一页,防幻觉。
AI 落地的最后一公里不是准确率,是可追责。
数字不能溯源,业务就不敢拿去用;不敢用,系统就上不了线。所以审核不做在别处,直接做进真实的工作界面里。
三道关:自查、对抗、复盘
「准确率高」是句空话,扛不住追问。我们把「怎么保证不出错」做成了三道明确的关卡——每一道都是产品的一部分,不是口头承诺。
自查
AI 每出一个结果,再单独写一段校验代码,回原始文档把来源撞一次。撞不上的,不硬猜——标出来交给人。
对抗
上线前留一套系统从没见过的考卷,让另一个 AI 拿着标准答案当裁判,把任务从头重做一遍、逐项对答案。自己人挑不出的毛病,对手挑得出。
复盘
人纠的每一个错——错在哪、应该是什么——结构化存档,定期萃取成新经验。审过一次的错,永远不再犯。
还有一条纪律贯穿三关:宁可交人,绝不硬猜。系统没把握的每一条,进「漏网表」如实交人裁决——数字员工先学会的不是能干,是如实汇报。
验收标准也不用「准确率高」这种虚词,用你行业自己的标准:财务的验收是可入账、过得了审计;环保的验收是敢报给政府;物流的验收是商务敢直接发给客户。做到你行业的专业级,才算数。
审核即评测:人每纠一次错,系统就进化一次
交付的不是一次性软件,是一个越用越聪明的数字员工。有个必须守住的分寸:不能来一个错误就改一次代码——那样改,模型的灵活性就被改没了。整件事一直在两个方向上找平衡。
AI 每出一个结果,为它单独写一段代码,回原始文档把来源再撞一次。
每个数字点一下,直接跳回它来自哪份文档的哪一页。审核和干活在同一个界面完成。
人审核发现的每个错误——错在哪、应该是什么——结构化存进后台。
攒够 case,让 agent 抽象错误、更新经验。审过一次的错,永远不再犯。
人走了,判断力留在公司。老师傅会退休,AI 学到的经验不会走。
差一点就是人命的场景里,练出来的精度纪律
创始人 9 年 AI 一线:小米对标特斯拉的自动驾驶数据闭环与算法产品、8 年 AI 评测与数据体系、真格基金黑客松获奖的大模型评测平台。ExcelMaster 在海外与全球最强的 Agent 团队同台竞争,10000+ 用户每天在用。认识一下这个团队 →
我只不过是把今天 AI 的上限摸到了给你看。别人给你做不好,是因为他们的水平不够。
—— 98 分测出来那天,我们对客户老板说的话顺手送你一套供应商检验法
不管最后找不找我们,挑 AI 供应商时,这三条都能帮你省下几十万学费。
问他的 Agent 架构
答案若是「工作流编排」「可视化流程画布」「多 agent 编排」——大概率是上一代的东西套了新名字。答案若围绕 Agent 加自检加审核加评测展开,你大概率遇到了跟得上这一代的人。
看这家公司的老板
老板自己对 AI 有认知吗?有不少上百人规模的软件公司,老板连最前沿的 AI 编程工具是什么都不知道。自己都没搞明白这一代 AI 的老板,怎么带团队给你交付这一代的东西?
看人数和协作方式
动辄几百号人,前端等后端、后端等接口——人员冗余在今天不再是实力的证明,是效率低下的证明。找上一代的组织做这一代的业务,等于找恐龙给你服务。
效果好才是最重要的。效果不好,一切白搭。
有个准确率始终上不去的项目?拿来考我们
为什么敢不收钱?因为我们对自己的方法和实力有绝对的信心。东西做出来之前,我们担心你不签约;做出来以后,是你担心我们不签约。
免费诊断 免费
1 天驻场,从老板聊到一线员工,给你一张「AI 机会地图」。
免费 POC 免费
2~3 天,用你的真实数据做出能跑的系统。题目你出,现场盲测——效果亲眼看到,再决定给不给钱。
按结果签约
项目费保底 + 效果挂钩。我们和你一起对结果负责。
全年陪跑
每次人工审核都沉淀成 AI 的学习材料,系统越用越聪明。
手里有做失败的 AI 项目?拿来考我们。
我们最好的几个客户,都是这么开始的。多个客户验收后的第一反应,是主动提出「我帮你介绍给同行」——我们最好的销售,是客户本人。