一行请求做出的两张地图 — AI在工作中能做什么、不能做什么
只给AI一行请求,能否得到真正可用的成果?我们做了两张地图来验证。在40分钟得出的结果背后,数据被整体替换了两次,还要抓出两处计算错误才算完成。本文用这两个实际案例,梳理工作中哪些事现在可以交给AI、哪些还不能,以及最危险的那一类——形式完整、看上去可信、内容却是错的成果——应该如何在进入汇报链之前识破它。
能不能做出来,已经不是问题。 谁来确认做出来的东西是对的,这才是问题。
上周末我们做了两张地图。一张显示首尔烟花大会在哪里看得最清楚,另一张显示全国秋季花卉何时何地进入盛期。
每一张的请求都只有一行。
这篇文章不是为了炫耀成果。我们真正想知道的是另一件事。这种方式能不能搬进公司的业务,如果能,能到什么程度。 我们把两张地图实际做出来,就是为了找到这条边界。
我们做了什么
第一张是观赏点地图。 请求只有一句:"用首尔地图和高程数据,把烟花在哪里看得见做成热力图。" 40分钟后,一张按30米见方把首尔切成99万格、逐格计算视线是否通畅的地图完成了。
第二张是秋季花卉地图。 我们说:"把要看某种植物该什么时候去哪里,叠到地图上。" 它收集了全国62处的盛期时间并放到时间轴上,拖动日期,只有那个时点正在开放的地方会亮起来。
以前为什么做不到
同样的事放在几年前,会卡在两个地方。
第一,不知道有这样的数据。 欧洲空间局的全球高程数据、欧盟委员会的建筑高度数据、韩国山林厅的红叶预测。全都免费公开,但你得先知道它存在才会去找。这在很长时间里才是真正的瓶颈。
第二,突破文件格式要花好几天。 卫星数据用的是陌生的文件格式和陌生的坐标系。光是装好专业工具、学会用法就要几天。
现在这两件事都只要几分钟。但瓶颈不是消失了,而是转移了。
新的瓶颈是验证
工作途中发生了这样一件事。
取来高程数据一看,汝矣岛Parc1所在位置显示为13米。那里立着一栋333米的建筑。换一份数据再看,这次63大厦是18米。
原因很简单。全球高程数据大多是为了测量地面而制作的,建筑被当作噪声抹掉了。这对地质调查或洪水预测是对的,但对判断城市中视线是否通畅这件事,恰恰完全没用。
这里关键的一点是:这份数据没有报错。 格式正常,坐标正确,数值齐全。如果就这样算下去,地图会毫无阻碍地完成。只不过那会是一张错误的地图,而且多半没人会发现。
形式完整的成果最危险
这是我们最想说的一点。
AI产出的风险不在于给出离谱的答案。离谱的答案很容易被看出来。危险的是形式完整的成果。 长得像地图,人就相信它是地图。带着表格和数字的报告形式,人就相信它经过了核实。
在组织里这个问题会被放大。一线做出的材料沿着汇报链往上走,追溯数字来源的人越来越少。越往上走,那份材料看起来越确定。
所以我们这样总结:AI落地的成败,不取决于能做出什么,而取决于是否同时建立了确认它是否正确的环节。
能做的和还做不到的
做完这两件事,边界变得相当清楚。
| 现在能做的 | 还比较难的 |
|---|---|
| 串联公开数据得出答案的一次性分析 | 必须持续运行的生产系统 |
| 把被格式挡住的资料打开 | 没有内部数据支撑的业务判断 |
| 为决策收集依据 | 没人验证的自动判定 |
| 决定要不要做之前的原型 | 涉及监管或安全的责任领域 |
左边是错了还能回退、并且有人会核对的工作。右边是难以回退,或者错了也不会被察觉的工作。
生产系统尤其如此:做出来和维持住是完全不同的两件事。40分钟做出来的东西,40分钟也能改;但半年后出故障时有没有人接手那段代码,是另一个问题。这部分我们在AI智能体一年回顾里谈过。
实务中真正有效的四件事
把目的和成果的形态一起说清楚。 第一次的请求里既有"哪里看得见"这个目的,也有"做成热力图"这个形态。只说目的会得到一张表,只说形态会得到好看但没用的东西。
不要指定数据,而要索取出处。 有哪些公开资料,机器比人知道得多。如果当时点名了某一份数据,建筑就会一直缺着。相反,问一句"这个数字从哪里来",依据就会跟着出来。第二张地图里出现山林厅的预测资料,正是因为这个问题。
结果不对劲时,请它给出依据。 南山山顶算出0分时,一句"给我看看为什么会这样"拉出了两处计算错误。不问这一句,就会原样收下一张错误的地图。
先问清楚局限。 问"这个结果里哪些部分不该相信"。如果答不上来,那份成果就还没做完。
成本怎么算
这类工作的成本主要不是人的时间,而是token,读的资料越多、反复推敲的次数越多就越高。报价和实际费用为什么会有差距,我们另外整理在AI到底要花多少钱。
补充一点:越是需要反复推敲的工作,成本越高。 但省下推敲,出来的就是前面说的那种形式完整却错误的成果。验证的成本与其说是要削减的对象,不如说是要接受的成本。
结语
这类工作最近常被称作"一键搞定"。真做过之后我们发现,这个说法的含义有点不一样。
不是工作变少了,而是人动手的次数变少了。 原本夹在中间的判断没有消失,而是移到了机器那一侧;移走多少,确认那个判断是否正确的工作就有多少新落到人身上。
如果您在评估AI落地时只看"什么可以自动化",那只看到了一半。另一半是"当结果出错时,谁在什么时候会发现"。这就是两张地图给我们的结论。
如果员工们已经各自在用AI,那么如何建立验证环节会是更紧迫的问题。这部分我们在员工其实已经在用AI了里谈过。