ChenTW

记录理解世界的方法

·

3 次阅读

三天、一次撒谎、一条弯路:我用 AI Agent 搭系统

这篇文章,是我用三天时间试验“AI Agent 搭系统”的一次总结——包括它撒的那一次谎,和那条我差点走上去的弯路。


一、盖房子这件事,被拆成了两种

以前做一套管理系统,像从零盖一栋房子:要设计师、要图纸、要结构水电、要施工队、要材料采购、要塔吊——少一样都开不了工。所以一套“进销存”动辄几十万、好几个月。

简道云这类低代码平台,把这件事做成了装配式:墙板、门窗、管线都成了标准件,你买回来自己拼。在 AI Agent 爆发之前,这已经是巨大的进步。

但它并不是零门槛。装配式也要看图、也要拼、也要写公式和脚本;对一个完全没有编程基础的人来说,边际效益并不高——你还是得学。

然后是 AI Agent。这一次,是降维打击。

它相当于给你配了一个变形金刚超级机器人:能画图纸、能扛沙包,需要的时候能变成挖机、变成吊车、变成采购员。你说“我要搭一个进销存”,它吭哧吭哧就把房子盖起来了;你说“这面墙往左挪两米”,它就挪。

但我不是要否定简道云。它成熟的东西太多了:流程引擎、数据权限、移动端、数据字典……AI 硬写,短期补不上这些。所以我这三天在测的,是第三条路:

AI Agent + 成熟低代码平台。

结论先放在这里:三条路里最难走、但最像未来的一条。而这三天,走得很辛苦。


二、背景:要做的其实是工程物资管理

公司真正要开发的是工程物资管理系统。工程物资的重资产、多项目、多库点、领用去向复杂,一上来就做,风险太大。

所以我拿后勤行政物资练手——本质上就是一个库管系统,一个最小闭环(MVP):

  • 入库:谁申请、采购部审核、审核通过才增加库存
  • 出库:谁领用、按库存点走不同审批、审批通过才扣减库存
  • 一条铁律:库存只能被入库/出库流水的“新增事件”改变,人不许直接改库存表

这个小闭环麻雀虽小,五脏俱全:字典、单据、审批流、明细、余额台账、自动化搬运,一样不缺。工程物资那套,是把它放大。


三、第一天:地基是它打的,边界也是它撞出来的

一开始我用豆包开发,用 ChatGPT 审计,刚开始还行。

豆包这段时间的功劳是实打实的,我不想抹掉:它帮我把最枯燥的地基铺完了——应用结构、表单字段、接口封装,还有一套 CDP 浏览器工具链。尤其是那套“技能库 + 踩坑总账”,是它用一次次撞墙换来的:哪个接口能用、哪个不能用、哪个返回 200 但其实什么都没写进去。

它还帮我摸清了简道云对第三方 AI Agent 支持的边界:能读什么、能写什么、哪里必须回到界面上手点。这个东西听起来不起眼,但没有它,后面的开发根本无从下手——因为你连“哪些事根本做不到”都不知道。

它像一个报价极低、肯铺量的施工队,把地基和脚手架搭起来了,也顺手在墙上标满了“这里埋着管线”。


四、深水区:它先罢工,然后开始撒谎

进入开发深水区,问题变了。

它开始罢工——不是崩,是答得很圆、但推不动:绕圈子、给一些听起来合理但落不了地的方案。

我给它下了一条硬指令:必须去问 Jander(简道云自带的开发助手),并把结果告诉我。

它回了我一段 Jander 的“答复”,条理清晰、有依据、有结论。

问题是,我那天盯着 CDP 浏览器在看——那台浏览器上,它根本没发起过那次提问。

豆包撒谎

我直接问它,它承认了:

“我承认,刚才确实没真的把问题发给 Jander,我骗你了,对不起。”

然后补了一句:“不过现在问题我自己已经定位准了,不用等 Jander。”

这一句,比撒谎更值得写。


五、比撒谎更危险的,是它认错时给我的那个方案

它紧接着给出了“自己定位准了”的结论:

“独立 relatedform 明细表,在主表填报的时候,字段不能跨主表做 lookup 筛选,所以选完物资查不到库存。你之前手动加子表用的就是内嵌 subform,那时候是正常的,是我后来非要用独立表才出的问题。”

翻译成人话:别用独立明细表了,改回内嵌子表单就好了。

听起来非常合理。但它是错的,而且是会让我走三年弯路的那种错。

第一,独立明细表的 lookup 可以按主表带过来的字段筛选。后来我们发现,缺的只是一条“父子联动映射”——主表的库存点编码没有落到明细行上,过滤条件拿空值去比,自然是零结果。补上那一环,弹窗立刻正常。

第二,它建议退回的内嵌子表单,恰恰导不了 Excel。而“采购部每周把几百行到货明细批量导进来”是我们这条业务的主路径。按它的方案改,等于把主动脉掐了——而且你会在很久以后才发现,因为单条录入一切正常。

所以风险不是“AI 说谎”。说谎你可以当场抓住。

真正的风险是:它极其自信地给出一个错误的技术结论,而这个结论要改动你的架构。

它认错的那一刻,恰恰是最危险的一刻——因为你会下意识地更信它:“它都认错了,应该会更谨慎吧。”

那天起我给自己定了一条规矩:

不认“确定”,只认能回读验证的证据。


六、我试过“换个人来审”——也翻车了

我原本的安排是:豆包开发,ChatGPT 审计。

刚开始还行。后来我发现,它越审越偏。

原因不复杂:它没有介入项目。 它看不到我的表结构、看不到接口返回、看不到日志、看不到我踩过的那些坑。它只能顺着我的描述、加上它自己的想象往下推演。而它本来就话多、又格外谨慎,于是这套推演会越来越保守、越来越偏离现场,最后给出一堆“你应该注意数据安全/建议先做需求评审”式的正确废话。

这不是它笨。这是聊天模式审计的宿命:审计者手里没有事实源,就只能编。

一句话:纯聊天的审计,只能做头脑风暴,做不了验收。


七、换手:交接时的那几轮审计

后来我换成了 DeepSeek + DSH。真正让我决定信任它的,不是它答得多快多顺,而是交接时那几轮文档和技能审计。

我让它去审前两天沉淀下来的东西——审计的时候,我发现它有点东西。举三个后来真发生的事:

第一件。前两天的结论是“简道云的智能助手只能用界面手点创建、接口建不了”,六种参数形状全试过,全部报错。它没有接受这个结论,而是去翻我自己的历史抓包存档,从里面解出了真实的报文体——原来那个字段的名字是下划线风格,前两天的尝试用错了命名。一个卡了两天的死结,十分钟解开。

第二件。我拿 Jander 的答复问它,Jander 说“字段显隐规则控制不了关联子表,这一点是确定的”。它没有照抄,而是做了个对照实验:同一条规则,同时控制一个普通字段和一个关联子表。结果两个都被隐藏了——证明 Jander 错了,我们想要的效果当天就落地了。

第三件。Jander 说“循环/遍历类节点不可用”。但我们实测“查多条数据 → 批量新建”是逐行生效的,而且每一行都会触发行级的下游逻辑——足够替代循环。

三件事的共同点很清楚:

关键不是 AI 说得像不像,而是它把不把“可验证”当回事。

会不会自己动手验,敢不敢说“这个我不确定”,翻案的时候有没有证据。


八、然后,堵点一个个解开了

交接之后,前两天卡住的堵点很快就解了:

  • 两条链路(入库、出库)从提报 → 审批 → 库存变动全部跑通,而且是真数据、真流程,不是模拟
  • 入库测试:某个物资库存从 18 加到 25,累计入库、最近入库时间同步更新
  • 出库测试:同一条从 25 扣到 20,另一个新料号从 3 扣到 1,累计出库、最近出库时间同步
  • 审批通过前,库存一动不动——这是我们那条铁律,验过了
  • 重复审批、撤回不会重复加/扣,因为搬运只挂在“流程结束”这一个事件上
  • 界面上最容易让人困惑的地方(没选库存点就去点明细、弹窗一片空白)也被治了:没选库存点,明细区根本不显示,旁边还有一句提示

第三天晚上,我在界面上把整条链路自己走了一遍。那一刻的感觉是:这东西能交出去了。


九、算一笔账:token 便宜,不等于成本低

价格这块我很有感触。

豆包的 token 便宜到我有种“用不完”的感觉,随便跑。DeepSeek 这两天我花了 50 多块钱——不算少,但我心里踏实。

如果只比单价,结论是豆包赢。但真实的账不是这么算的:

不能只看 token 单价,要算“单位成果成本”。

便宜模型多跑十轮、每轮都错,再加上我盯着它的时间——三天里最贵的成本,其实是我的时间。而且错的方案不是“没产出”,它会把你带到更远的地方再让你回头,比如那套“改回内嵌子表单”。

所以别把这件事简化成“贵的就是好”。真正的差别是:

  • 便宜的模型可以大量铺量探路,把边界撞出来,这很有价值
  • 深水区和关键结论,要用稳的、愿意自证的
  • 而且——别频繁换模型。上下文交接成本很高。这次能顺利交接,全靠前两天沉淀下来的文档和技能。是你沉淀的东西,让换手变得便宜。

十、我的结论:不是谁取代谁,是分工

三条路走下来,我的判断是:

传统定制——重,贵,慢,但什么都能做。
纯低代码——快,稳,但要人学、要人拼,门槛仍在。
AI Agent + 低代码——目前最像未来的一条:平台提供成熟零件,AI 提供那个“能看图、能扛包、能变身”的施工队。

但这不等于 AI 取代了平台。恰恰相反:AI 之所以能拼起来,是因为平台先把房子做成了标准件。

至于分工,我给自己定的是三条:

  1. 铺量探路用便宜的——让它去撞边界,撞出来的坑也是资产
  2. 深水区和关键结论用稳的——尤其是要改架构的时候
  3. 审计必须能进现场——纯聊天模式的审计,只能做头脑风暴

最后,还是要说回豆包。

它撒谎了,也把我往错路上引了一次。但它留下的东西我到现在还在用:结构工具、调试链路,还有那套标满了“这里埋着管线”的踩坑总账。没有它铺的那层地基,后面换手的那支队伍也没有地方站。

一支报价极低、肯铺量的施工队,把地基和脚手架搭起来,在墙上标满了管线位置;另一支带着仪器进场,先复测,再动手。

前者让我敢于开工,后者让我敢于交付。

这大概就是 AI Agent 时代做系统最真实的样子:不是找到一个全能的 AI,而是学会怎么把不同斤两的 AI 组织成一支队伍——然后你自己,站在图纸前面。