news 2026/9/6 4:35:17

GPT-6之后,软件公司真正要卖的是什么?

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
GPT-6之后,软件公司真正要卖的是什么?

作者:合同吴彦祖

9月3日,OpenAI发布GPT-6 Astra,称它是目前能力最强的模型。发布页把软件工程、计算机操作、科研和复杂专业工作摆在最显眼的位置:做网站、写代码、操作电脑、完成研究任务,过去需要几种工具和几个人来回配合,现在越来越像一句话交代下去,AI自己把事情做完。OpenAI公布的GPT-6 Astra资料里,还专门强调了它处理长流程任务、遵守既有模板和持续理解上下文的能力。

第二天上午,公司几个年轻人围在电脑前试了起来。有人让它搭后台,有人让它改页面,还有人只说了一句“给我做个能用的合同管理系统”,没过多久,登录、审批、台账和统计图都摆在了屏幕上。一个小伙子转过头问我:“哥,以后软件是不是更卖不出去了?”

这个问题听着像一句玩笑,我却没马上回答。就在几年前,我们还在向客户解释,一套企业软件为什么需要几十个人、几个月时间;现在,一个刚入行的年轻人坐在工位上,给AI下几条命令,就能做出一套看起来像模像样的东西。过去软件公司写进报价单的工作量,正在以肉眼可见的速度缩水。

这种焦虑也不只属于办公室里的年轻人。今年我接触到的不少ToB公司,本来就在为项目减少、预算收紧和回款变慢发愁。过去软件卖不动,老板还可以安慰自己是行情不好;现在AI一天做出一套Demo,他会进一步怀疑,客户以后是不是连买软件的钱都不愿意出了。

偏偏在GPT-6发布前两天,马斯克又在G20创新部长级会议上给出了一张更激进的时间表:到2027年底,AI可能完成几乎所有纯数字任务;写软件会强到人类无法与之竞争。GPT-6一发布,这段讲话又在各种群里流转,两个消息叠在一起,像是专门往ToB老板的焦虑里添了一把火。马斯克G20讲话视频及文字记录 于是朋友圈里很快有人宣布:AGI时代到了。对本来就在不景气里找出路的ToB老板来说,这种口号听起来不像一条普通的技术新闻,更像一张倒计时:客户还没回来,AI先来拆原来的价格体系;如果公司现在不变,明年是不是就来不及了?

OpenAI自己其实没有在这次发布中宣布人类进入AGI时代。所谓AGI,通常是指一种能够跨越不同领域,像人一样理解、学习并完成广泛智力任务的通用人工智能。它没有全行业统一的毕业考试,所以每次模型能力突然跃升,总有人宣布它已经到来,也总有人坚持它还差得很远。但这一次,我还是想站出来说两句:他们的判断,至少在现在还不对。

几个月前,Claude Fable 5刚发布时,也被放在“最强AI”的位置上。Anthropic称它是自己当时公开提供的最强模型,在绝大多数能力测试上处于领先水平。Anthropic对Claude Fable 5的发布说明

我后来真正用了一段时间,并没有感觉它已经强到可以把人从工作里拿掉。任务边界清楚、材料准备完整、验收标准明确时,它确实很快;可只要需求里藏着矛盾,业务规则没有说透,或者前面一个修改影响到后面几条流程,它仍然需要有人告诉它哪里理解错了、什么东西不能动、下一步应该怎么改。而且指挥AI的人不能只会说“这里不对,再改一下”。他得懂系统里的逻辑为什么这样连,明白业务人员真正想解决什么,还要知道这次修改会不会伤到别的流程。模型可以比过去更快地给出答案,但答案好不好,仍然取决于前面那个人能不能把问题说清楚,后面又能不能看出它改错了什么。

我的实际感受是,所谓“最强AI”首先放大的,往往是使用者原来就有的能力。懂业务、懂逻辑、会验收的人,可以让它一天干过去一周的活;自己都不知道结果应该是什么的人,只会更快得到一套看上去完整、实际上没人敢负责的东西。

马斯克把“能生成”,直接算成了“能完成”

图1:马斯克在2026年9月1日G20创新部长级会议上的视频讲话。来源:Elon Musk Archive;点击图片可查看完整视频。

先承认马斯克说对的部分。代码本来就是数字世界里的东西,它可以复制,可以测试,也可以在几秒钟内重写。模型越强,生产代码的成本越低,软件公司过去依靠程序员数量建立的产能优势,肯定会被打掉一大块。

但马斯克谈的是机器能够生产多少数字成果,企业购买的却是一份能够进入经营、持续运行并且有人负责的工作。两者中间隔着需求、规则、验收和责任,他把这段最麻烦的路直接跨过去了。

一个AI可以生成十万行代码,企业要的却不是十万行代码。企业要的是销售录错价格时系统能不能拦住,合同金额改过以后谁能看见,审批人休假时流程怎么走,客户告上法庭时能不能拿出当时的版本和操作记录。代码只是这些问题最后留下来的形状,真正的工作藏在代码前面和后面。所以,AI越会写代码,软件项目里那个一直被代码遮住的问题反而越明显:谁来定义它到底该做什么,谁来判断它真的做对了,出了问题又由谁负责。

AI做出一套软件,企业却不知道自己拿到了什么

我们还是拿合同系统举例。一家公司对AI说“帮我做一套合同管理软件”,然后让它自己拆需求、设计数据库、生成页面、配置权限、编写审批流程,最后再自动跑完测试。几天以后,一套系统摆在面前,登录、台账、审批、用印和统计报表一项不少,看上去比许多花几个月做出来的项目还完整。

问题是,在这几天里没有人真正跟着它工作。AI为什么把“已盖章”当成合同生效,为什么允许发起人撤回已经通过的审批,为什么分公司管理员能够看到总部合同,为什么补充协议修改后直接覆盖原金额,这些决定都已经变成了字段、条件和代码。企业只看见页面能打开,却不知道里面埋着一套什么样的业务逻辑。

这时企业拿到的其实是一个黑箱。销售不知道遇到紧急订单应该从哪里发起,法务不知道系统有没有绕过审查的入口,财务不知道报表里的金额按含税还是未税统计,管理员也不知道删除一份合同以后,审批记录和附件会不会一起消失。软件确实做出来了,具体应该怎样使用、是否符合企业实际、是否满足合规要求、有没有隐藏问题,企业全都不知道。

这种“不知道”不会因为AI同时生成了一份说明书就自动消失。说明书仍然是AI按照自己的理解写出来的,如果没有人把里面的规则与真实业务逐条对照,文档和代码可能只是用两种形式重复同一个误解。测试全部通过也不能证明业务正确,因为测试验证的是系统有没有按照既定规则运行,没有回答那条规则一开始是不是企业真正想要的。

最后企业只剩下两个选择。一个选择是先把系统用起来,等真实合同、真实付款和真实审计撞上问题以后再修改;另一个选择是找人重新阅读代码、梳理流程、检查权限、核对数据口径,把AI几天里作出的决定从系统里一点点还原出来。前者拿经营去试错,后者等于在项目结束以后,重新补做一次需求分析和系统验收。

而且负责还原的人仍然要懂业务,也要懂软件逻辑。他必须知道“合同生效”在这家公司究竟意味着什么,能看出一个权限配置会影响哪些人,还要判断修改一条规则会不会伤到后面的付款、履约和归档。否则他看见的只是更多代码、更多文档和更多测试结果,仍然无法告诉企业这套东西能不能放心使用。

这就是为什么AI做软件的费用可以很低,企业真正把它用起来的费用却未必一起下降。你可以不安排人跟着AI,但后面就要花钱找人理解它已经做了什么;你也可以从第一天就安排人盯住关键逻辑,但这个人必须不断检查、解释和纠偏,AI的速度最终又会受到人类理解速度的限制。AI交付了一套软件,不等于企业获得了使用这套软件的能力。只有里面的逻辑被人理解、被业务确认,出了问题也有人知道从哪里改,它才真正属于这家公司。

AI可以一直干,偏差也会一直往前走

人和AI还有一个很不一样的地方。一个程序员做了两天,通常会停下来开会、汇报、演示,团队因此知道他改了什么;AI可以在夜里继续拆任务、改数据库、补接口、跑测试、重构旧代码。它不累,也不会因为凌晨两点产生怨气。

这当然是它最诱人的能力,也是最容易被忽略的风险。如果AI连续工作的过程没有被人看见,人类看到的只是最后那个“已经完成”的结果。中间改过哪些假设,删掉过什么约束,遇到冲突时选了哪一边,它可能都处理了,但组织并没有因此获得理解。

假设它在迁移合同时,把“盖过章”理解成“已经生效”。第一批数据导入以后,页面正常,数量也对,它便沿着这个口径继续生成履约计划、付款提醒和风险报表。等到财务发现一批已经盖章但附条件生效的合同也被算进应付款,错误早已从一个字段进入了后面所有流程。

它不是每一步都做错了。恰恰相反,它后面的每一步都忠实执行了第一步的错误理解。任务跑得越顺,报表做得越漂亮,人越容易相信它已经完成;等问题暴露,再想找出偏差从哪一步开始,往往比重新做一遍还难。我们不妨再做一个极其宽松的假设:AI每一轮任务发生偏差的概率只有0.01%,也就是做一万次,平均只有一次可能偏离要求。单看一轮,准确率已经高到足以让任何老板兴奋。

可是连续工作不是只做一轮。假设每轮偏差彼此独立,1000轮里至少出现一次偏差的概率约为9.5%;到1万轮时是63.2%;到10万轮时,至少出现一次偏差的概率约为99.995%。这里算的只是“有没有发生过”,并不代表每次偏差都会造成事故,也不代表某个模型真实的错误率就是0.01%。它说明的是:单轮看起来可以忽略的误差,放进足够长的任务链以后,就不能再靠运气管理。

图2:作者根据情景假设测算。假设每轮独立出现偏差的概率为0.01%,至少出现一次偏差的概率为1-(1-0.0001)^n;这不是任何具体模型的实测错误率。

现实通常比这个公式更麻烦,因为AI的错误很少彼此独立。第一步误解了“有效合同”的口径,后面生成的数据库、接口、报表和预警都会沿着同一个错误继续生长。偏差不像平均撒在十万个步骤里的灰尘,更像铁路起点处扳错了一次道岔,列车跑得越快,离目的地越远。

很多人设想,未来一个人可以管理几百个甚至几千个Agent。可管理从来不是把任务点一下“开始”。如果1000个Agent一天作出几万次判断,人不可能逐条阅读;如果完全不读,他又不知道哪些判断沿用了过期目标,哪些异常被AI当成普通情况处理,哪些决定已经越过授权边界。AI的产能可以成千上万倍复制,人类的注意力却不能下载扩容包。

人要看的,是AI准备改变方向的那一刻

如果解决办法只是让人把AI生成的每一行代码、每一次操作重新检查一遍,事情又会回到原点。AI写十万行代码,人再用过去审十万行代码的方式从头看完,机器确实快了,企业整体却没有快多少。原来花在生产上的时间,只是转移到了检查上。

人真正需要看的,不是AI的鼠标每一秒移到了哪里,而是它准备在哪些地方改变后续方向。它采用了什么业务口径,遇到冲突时依据哪条规则,准备删除或覆盖什么数据,哪些动作做完以后很难撤回,最终拿什么证据证明任务已经完成。这些节点数量远少于全部操作,却决定后面的工作是在接近目标,还是带着一个错误越跑越远。

合同迁移时,AI发现一批历史文件没有统一的客户编码,它可以停下来报告异常,也可以根据名称自动合并。如果只是测试环境,先合并再检查也许问题不大;如果马上要覆盖财务主数据,一次错误合并可能把两家同名公司变成同一个客户。该不该继续,不由AI有多聪明决定,而由这一步的后果有多大决定。

所以人在任务开始时要给边界,在关键节点要作取舍,结束以后还要验收。普通、可逆、容易验证的步骤可以让AI快速通过;改变目标、越过权限或者可能造成重大损失的动作,必须重新回到人面前。监督设计得好,人不用看完所有过程,也能知道工作为什么来到这里;监督设计得差,人看到的就只剩一张“任务已完成”的报告。

有人会说,那再安排一个AI检查它不就行了?当然可以,而且大量常规检查本来就应该交给机器。但审查AI仍然需要一套判断标准,如果最初把“盖章”定义成“生效”,生成AI和审查AI可能沿着同一个口径得出两个完全一致的答案。两个AI互相同意,只能证明它们使用了同一套逻辑,不能证明这套逻辑就是企业想要的结果。

这就是人类监督最麻烦的地方。不看,偏差可能在长任务里持续放大;看得太细,人的速度会成为整个系统的上限。企业真正要解决的,是怎样让AI连续工作,同时让少量但关键的决定及时浮到人面前,由真正理解业务、拥有授权并愿意承担后果的人作出选择。AI提高效率,不是让人从工作里消失,而是让人少做那些可以稳定重复的步骤,把注意力留给会改变方向和责任的决定。人的位置也随之变化:过去亲手生产每一个结果,未来持续定义结果、检查结果,并决定是否接受结果。

陶哲轩担心的,也是产出跑在理解前面

这个矛盾在数学界表现得尤其明显。GPT-6的发布材料把数学能力摆在了非常醒目的位置,而在它发布以前,陶哲轩已经是最积极尝试AI的数学家之一。他用AI查文献、写程序、画图和做计算,认为当时的模型用于数学研究,已经到了“节省的时间多于浪费的时间”的阶段。

但他的担心恰好发生在AI越来越能做题以后。数学成果并不是“证明出来”就结束了,一项新结果还要被同行检查,与旧理论连接,被整理成容易理解的方法,最后进入教材和共同知识,才真正改变后来的人怎样思考。陶哲轩在2026年国际数学家大会的文章里,把问题从“AI能不能做研究级数学”转向了另一个方向:如果它真的能做,我们希望数学研究最后留下什么?

假如AI一天给出一万条正确证明,人类却没有时间阅读、消化,也没有能力判断哪些问题值得继续研究,数学论文的数量会暴涨,数学共同体的理解未必同步增长。答案越来越便宜,形成问题、选择方向、组织知识和培养下一代数学家的过程,反而可能被挤压。问题不再是AI会不会做,而是人类能不能把它做出来的东西变成可以继续使用的知识。

数学已经是最适合AI连续工作的领域之一,因为一份形式化证明至少可以交给Lean这样的工具逐行验证。企业软件没有这么幸运。合同审批是否“正确”,经常不是一个能够由机器证明的命题,而是业务、法务、财务和老板在特定时刻作出的取舍;市场变了、人员变了、监管变了,昨天的正确答案今天就可能失效。如果数学这种最容易验证对错的工作,都需要重新建设验证、筛选和知识沉淀的机制,那么企业不可能只买几个Agent,就把自己的数字工作全部放心交出去。

软件便宜了,企业为什么还要花钱

回到最初的问题:AI能不能帮你做一套很好的软件?能,而且会越来越好。未来大量低风险、短生命周期的软件,确实会像一次性表格一样随用随做:活动报名页、临时报表、小型内部工具和个人工作流,未必还值得走一遍传统采购。但一套真正进入企业经营的软件,成本从来不只发生在“做出来”的那一天。它还要持续回答,规则变了谁来改,数据错了怎么恢复,权限越界怎样发现,AI做过什么能否追溯,业务人员看不懂时谁来解释,系统停摆造成损失时谁来承担。

这也是“让AI自己做一套”和“购买一套成熟软件”最容易算错的地方。前者的第一版成本可能极低,甚至一个下午就能看到页面;但第一版只证明软件能够出现,没有证明它能在公司里活下去。后面每一次制度变化、人员调整、数据修复、系统升级和事故处理,都需要有人理解原来的设计,再重新确定下一步结果。

成熟软件卖得贵,也不只是因为里面有多少行代码。它卖的是过去许多客户踩过的坑已经被做成规则,是版本升级时有人处理兼容,是服务中断以后有人响应,是审计追问时能够拿出记录。客户当然可以让AI重新生成这些能力,但他也要重新经历发现问题、定义规则、验证结果和长期维护的过程。

如果企业本来就有一批懂业务、懂系统、懂AI又敢作判断的人,自研当然可能大幅降低采购成本。可如果这些能力都要临时补齐,企业省掉的软件许可费,很可能又以人员、管理和风险的方式花回去。最后的投入未必比购买一套成熟软件少,只是钱从“买软件”转到了“养一群能够指挥、检查和接管AI的人”。

所以,最近有些做软件的博主开始判断,未来的软件公司可能不再卖标准软件,而会变成人力服务公司,依靠行业经验、客户关系和AI完成个性化交付。这个判断看到了代码稀缺性下降,却还少走了一步:软件公司的价值并不只是派几个人带着AI去做定制,更不是把过去的程序员全部换成会写提示词的人。客户真正愿意付钱买的,是一套可以被看见、被解释、被纠偏、被接管、被追责的持续工作系统

这套系统可能包含软件,也可能包含Agent;可能按年收费,也可能按结果收费。软件公司不再把主要成本花在重复写代码上,而是把客户说不清的目标变成可以执行的边界,把AI做过的事情变成可以检查的证据,把偏差挡在真正造成损失之前,并在客户不知道该怎么办时接过系统。过去软件公司比谁积累的功能多、代码多、实施人员多;以后更可能比谁能让更多AI在更长的链条上工作,同时还让客户知道它们为什么这样做。生产能力会迅速普及,能让组织放心把事情交出去的能力,才会变得稀缺。

AGI时代最贵的,是能为结果签字的人

马斯克判断AI会胜任所有数字工作,是从机器能力出发作出的预测。从机器能力看,他也许会比大多数人更早说对。但企业经营不是一场软件能力比赛,它还要计算失败落在谁身上,也要计算人为了避免失败,需要付出多少注意力。

GPT-6的官方发布材料里有一个很有意思的细节:模型更擅长长时间自主工作,但OpenAI同时承认,它的部分书面推理更难监控,因此又增加了自动审查、异常监测和必要时暂停任务的机制。连制造模型的人,都没有把“更聪明”理解成“从此不用看”。未来更现实的做法,是让AI连续工作,但把工作切成能够理解和验收的阶段。大量低风险步骤自动通过,改变目标、越过权限和造成不可逆后果的决定交还给人。这样会牺牲一部分理论上的最高速度,却能换来企业真正敢采用的速度。

人类仍然要反复出现,但不需要每分钟替AI纠正一个标点。他要在新事实出现时重新定目标,在多个可行结果之间作取舍,在机器说完成时决定是否接受。一个任务持续得越久,环境改变得越多,这种重新定义就越不可能只在开头发生一次。

那天上午,公司的年轻人问我,以后软件是不是卖不出去了。我后来告诉他,越来越难卖的,应该是一堆功能和一包代码。客户自己也能让AI生成,今天能生成一套,明天就能生成十套。但只要企业还需要为一次错误付款,只要有人还要在合同、资金、客户和监管面前签字,软件就不可能只剩一句命令。

未来最值钱的软件,未必是替人做得最多的那个。它应该让AI做了很多以后,人依然看得懂、管得住,也敢在结果上签下自己的名字。


一张图看懂本文

我是合同吴彦祖,也在持续研究AI进入企业业务以后,究竟怎样才能变成真正可用、可控的生产工具。

这轮AI变化,我们不是站在旁边评论。怎样让AI持续工作,又让人能够看懂过程、及时纠偏并为结果负责,也是我们正在产品和项目中反复验证的问题。

如果你也在做ToB软件、企业AI或者合同管理,欢迎交流。长文不易,如果你喜欢这篇文章,请关注我,点赞、收藏、转发,这是对我最大的支持。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 4:34:52

郑州高性价比冷库租赁全攻略:从温区、租金到 WMS 系统,一次讲透

选郑州高性价比冷库,看的不是每平方米多少钱。温区适配度、电力稳定性、数字化水平、作业损耗率、区位周转效率、租期灵活度,这六项才是真正决定综合成本的指标。这话听起来有点反直觉。多数人询价的第一句是"多少钱一平",很少有人…

作者头像 李华
网站建设 2026/9/6 4:34:37

Skill流程执行异常处理:库存不足排查与自动化运维解决方案

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/6 4:31:45

AI浪潮下程序员进阶指南:从RAG到Agent的实战路径

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/6 4:29:27

RISC-V高性能芯片技术拆解:自研微架构与生态落地的关键挑战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/6 4:27:48

基于SpringBoot的高校爱心慈善管理系统

作者:计算机学姐 开发技术:SpringBoot、SSM、Vue、MySQL、JSP、ElementUI、Python、小程序等,“文末源码”。 专栏推荐:前后端分离项目源码、SpringBoot项目源码、Vue项目源码、SSM项目源码、微信小程序源码 精品专栏:…

作者头像 李华
网站建设 2026/9/6 4:25:46

前端转AI前端:一周实战冲刺指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华