GPT6发布后,一个老问题又被提了起来:AI离AGI,也就是通用人工智能,到底还有多远?另一个问题更现实,它能不能让普通人的工作效率真正上一个台阶?
有人关心它能不能写程序,有人盯着3D建模,还有人直接问:电脑上那些每天做、做得又烦的工作,能不能交给它?这些想法并不离谱。OpenAI的GPT-6 Astra发布材料,确实展示了电路板、Blender建模、游戏开发和办公软件操作等任务。[1]
我认为,这次值得认真看待的,是它向更通用、更连贯的任务执行迈进了一步。这类能力如果能稳定进入日常软件,有望推动一轮生产力革命。原因得具体说,只列一句“会写代码、会做设计”,确实看不出它和上一代有什么不同。
以前的版本不也会这些吗?
会。GPT6并不是第一款能写代码、看图片、操作电脑的模型。OpenAI的技术文档也明确写着,电脑操作、多种工具调用等能力,在GPT-5.6中已经存在。[8] 所以,不能把“以前只会聊天,现在才会干活”当成两代产品的真实分界。
这次改进的重点,是一件事情涉及好几个步骤时,它能不能更连贯地做下去。按照官方文档,GPT6加强了跨代码、浏览器和专业软件的多步执行,还新增了异步工具调用和执行中的指令调整支持。[8] 换成日常说法,就是配套程序支持时,它等一项耗时操作的同时,可以继续做不依赖结果的其他事情;你中途补充要求,也能让它接着已经完成的部分调整。
拿做一个小工具来说,写出第一版代码只占一部分工作。后面还要启动、测试,看看手机上有没有排版问题,修改后再检查。相较于只评价“这段代码写得像不像”,现在更值得比较的是:同样一项任务,最后完成了多少,中间需要你接手多少次。
公开数据也能提供一些参照。在OpenAI公布的测试配置下,GPT6在AutomationBench上的得分为41.4%,GPT-5.6 Sol为18.1%;Terminal-Bench 4.0则分别为57.9%和37.3%。[1] 这些是特定测试的成绩,不能直接当成日常工作成功率,更不能理解成所有工作效率都翻了倍。
对用户来说,有价值的升级,是原来需要反复提醒、来回搬文件的一项工作,现在有机会少经过几轮人工接力。究竟少了多少,还是要用自己的任务来比。已经用上一代把流程跑顺的人,也不必为了换版本重新做一遍系统。
这算不算接近AGI?
讨论AGI,关心的已经不只是模型知道多少知识,还包括碰到没见过的任务时,能不能自己摸清规则、学习做法,并把目标完成。ARC-AGI-3这类测试,就让模型进入陌生的交互环境,观察它怎样探索和行动。[10]
GPT6在这方面确实交出了一份值得关注的结果。ARC Prize公布的ARC-AGI-3半私有测试中,采用厂商适配运行框架时,最佳成绩约为99.9%;采用标准运行框架时,最佳成绩约为62.7%。这是不同配置各自的最佳结果,不能把前一个数字单独拿出来,当作模型在任何条件下的表现。[9]
差别为什么这么大?该机构的说明提到,厂商适配框架能够在请求之间保留模型的推理状态,并为长任务管理上下文。[10] 通俗一点说,模型本身很重要,让它怎样记住进展、怎样继续工作,也很重要。
我的判断是,GPT6展示了更接近AGI所追求的通用能力,尤其是陌生任务中的学习和执行。但这不等于已经证明它接近一个公认的AGI终点,更不意味着“99.9%实现了AGI”。把一个基准测好,与在各种真实工作中都能可靠胜任,仍是两回事。
不过,生产力变化未必要等到AGI被正式确认才开始。一部分原本要人反复操作的工作,如果已经可以较可靠地交给AI,工作安排就可能跟着改变。对小团队和普通用户来说,这已经值得认真试一试。
具体到使用,视频里看着厉害,和自己用起来顺手,中间还有一些事情要弄明白。比如要装什么工具,要交给它哪些资料,最后得到的是一张效果图,还是一个能继续修改的文件。
对多数人来说,也没必要从造一个游戏、画一块电路板开始。手头那份乱七八糟的表格,也许就够了。
每周又要交报表了
假设你每周都要收几家门店的数据。有的表里写“销售额”,有的写“营业额”,日期格式也不一致。汇总之前,光是统一表头、删重复行,就要忙一阵。
这类事情,很适合作为第一次尝试。ChatGPT的工作模式已经把文件分析、文档、电子表格和演示稿列为可交付的工作类型。[2] 在具备相应工具的环境里,可以让AI读取原始文件,处理数据,再生成你能打开、修改的结果,而不只是告诉你“应该怎么做”。
要求也不用写得很玄乎。比如:“把这五张门店报表合成一份,按门店和月份汇总,保留计算公式。缺少的数据不要填成零,单独列出来。再做一张趋势图,原始文件别动。”
这句话里,真正有用的是后面几个条件。缺失值怎么处理、公式要不要保留、能不能修改原文件,都会影响结果。只说“帮我分析一下”,它很可能给你一份漂亮的总结,却没解决下周还要继续更新报表的问题。
做方案和PPT也是一样。把现有资料、使用对象、页数和参考样式一起交过去,比让它凭空写一份“高质量方案”更容易接近你的要求。初稿出来以后,再告诉它哪页太挤、哪段说不清楚、哪张图没有回答问题。
这里还有个小习惯值得保留:让它说明数据来自哪个文件、做过哪些处理。你核对总数、抽查几行,就能更快发现问题。格式整齐,不代表数字一定对。
让它自己点鼠标
很多评测里最有冲击力的画面,是AI自己打开软件、点击按钮、输入内容,遇到报错还会回头处理。看上去,确实有点像多了一个坐在电脑前的助手。
所谓“接管电脑”,更准确地说,是模型通过获得授权的工具来操作软件。它需要看到当前页面,决定下一步动作,再由工具执行点击、输入或其他操作。没有相应工具和权限,一个普通聊天窗口并不会自动接触你的电脑。[3]
所以,可以先挑一项边界清楚的工作试试。例如,把指定文件夹中的图片统一命名并生成目录;依据一份表格填写内部系统,提交前停下来给你核对;从已经授权的资料里整理客户信息,先形成待确认清单。
这些是可以拿来评估的任务,不是对任何软件都能成功的保证。登录验证、临时弹窗、权限不足,都可能让流程中断。刚开始最好用文件副本、测试账号,或者单独的工作目录。
尤其是发送邮件、删除资料、付款、修改客户正式记录,确认步骤要留着。你可以让它把事情准备到最后一步,但“已经准备好”和“已经发出去了”,差别很大。
现阶段,与其问它能不能替代一个员工,不如先问:这个员工每天重复做的哪一段工作,能够交给它,又方便检查?这个问题更容易得到有用的答案。
一直想做的那个小程序
不少人其实早就有自己的软件需求。门店想做个排班工具,老师想做个课堂练习页,小团队想把客户跟进记录集中起来。事情不一定复杂,只是以前为了这点功能,专门开发一套系统又觉得麻烦。
AI编程让这类想法更值得试一试。现在的工作方式,可以是先把需求讲清楚,由AI生成代码、运行项目、根据报错修改,再对页面和功能做检查。有工具配合时,它交出来的可以是能运行的原型,不只是一段代码。OpenAI的Sites文档也明确介绍了创建、托管和分享网站、网页应用及游戏的能力。[4]
但第一句话最好别是“给我做一个完整的管理系统”。
比如做排班,先约定员工名单从哪里来,班次怎样设置,调班有没有冲突,结果能不能导出。先让这一件事跑通。实际用两天,你会发现真正缺的是哪个按钮、哪条规则,再逐步补上。
网页工具、手机APP和微信小程序,也不是同一种交付物。网页能在浏览器里打开,不代表已经变成可以上架的APP。原生应用或小程序还涉及对应的开发环境、账号、权限配置、真机测试及平台审核。AI可以协助开发,发布要求仍然要逐项完成。
如果工具会保存客户资料、订单或账号信息,还要检查谁能看、谁能改,数据有没有备份。自己试用的小原型和交给客户长期使用的系统,后面的工作量差不少。别被一个已经能点的页面骗过去。
连电路板都能画了?
GPT6发布材料中的Blender和电路板演示,很容易让人冒出一个念头:以后是不是说句话,就能把专业设计做完?[1]
先分清你要的是什么。
做海报,可能只需要一张最终图片;改一套产品宣传资料,还会需要能继续编辑的文字、图层和素材。展示一个3D场景,重点可能是视觉效果;准备把零件打印出来,就要核对尺寸、结构和文件是否适合后续加工。它们看上去都叫“做设计”,实际验收的东西不同。
因此,给AI安排设计任务时,除了说“做得好看一点”,最好把用途、尺寸和最终文件格式一起写上。参考图也有用,但要说明借鉴的是配色、布局,还是某个结构,不要让它照搬一份并没有授权的作品。
专业软件的价值也在这里。一个可以继续编辑的工程文件,方便你检查结构、替换部件,而不是只能围着最后那张截图讨论。OpenAI公布的Playco案例,就是将GPT-6 Astra接入游戏开发工具,让它参与场景编辑、运行和测试,而不是单纯生成游戏画面。[5]
电路板更需要把“做出来的文件”和“验证过的产品”分开。AI能参与设计流程,是一件值得关注的事;元器件选型、封装、电气连接、布线约束以及打样后的验证,仍需要相应检查。板子画得像样,不等于通电就能稳定工作。
这些能力对懂行的人尤其有价值。你知道哪里该改、哪些条件不能放宽,就能把更多时间留给方案判断。刚入门的人也能借它把想法做成初步样子,但遇到自己无法判断的专业问题,还是应该请有经验的人复核。
遇到不懂的,随时问两句
学一项新东西,就可以换个问法。
不要只问“给我讲讲这个知识点”,可以把教材或说明书里没看懂的一段交过去:“先用日常例子解释,再问我两个问题,看看我到底懂没懂。回答错了,先提示,不要直接给答案。”这也是对话式学习很实在的一种用法。[2]
需要比较几种方案时,可以让它把资料摊开。比如几款家电的规格、几个活动场地的报价,先把你最在意的条件列出来,再要求它指出信息缺在哪里。比起直接问“哪个最好”,这种比较更方便你自己做决定。
碰到日期、价格、营业时间等会变动的信息,要让它查当前来源,并把链接留下。模型记住的旧信息,不能代替一次实时核对。涉及个人资料的文件,也应先处理掉不需要提供的身份证号、联系方式等内容。
这些用法并不是GPT6才突然出现的。新模型是否更好用,要看它能否在你的材料里少漏条件、少返工。对普通用户来说,能把复杂资料解释明白,能把分散的信息整理到一起,本来就是很直接的便利。
大模型进了工厂以后
前面说的,多数发生在电脑里。再往外走一步,比如仓库通道有没有被货物挡住,某个摄像头拍到的异常是不是误报,就需要把现场设备接进来了。
一种可评估的做法,是让前面的设备持续分析视频,发现候选事件后,把抓拍图片、全景和现场规则交给视觉大模型复核。哪些事件要复核,哪些直接通知管理人员,可以按实际任务设置,不必让大模型不停地分析所有画面。[7]
以薪火科技的边缘计算盒子为例,厂商公开资料列出了已有摄像头和NVR取流、本地视频分析,以及通过HTTP、MQTT向平台推送事件等能力。[6] 对需要保留原有监控、希望把识别和告警对接一起做好的项目,我认为这类产品属于行业里比较值得考虑的选择。理由是接入、分析、告警这些实施环节比较贴合项目需要,而不是仅仅因为它写着“能接大模型”。具体型号的兼容性和现场误报、漏报,仍要拿实际视频验证。
这里也别误会成“盒子里面装了GPT6”。边缘设备、管理平台和大模型服务是不同部分;后端可以根据部署条件评估适配的本地视觉模型,或接入取得授权的在线服务。是否能用某个具体模型,要看接口、权限、网络和数据要求。
对企业来说,最后要看到的是管理人员少翻了多少无效记录、真正需要处理的事件有没有漏掉。模型叫什么,是方案的一部分,不是验收结果。
拿手头的活试一次
先拿一件你熟悉、又觉得费时间的事来试。因为熟悉,你才知道AI做得对不对。
把原始资料给全,讲明白最终要拿到什么,再说明哪些地方不能改。第一次可以只给少量数据,等结果核对清楚以后,再扩大范围。遇到不满意的地方,直接指出来:“这张表少了一家店”“这页文字太多”“这个按钮在手机上点不到”。这种反馈往往比重新写一大段提示词有用。
还有一个容易忽略的前提:GPT6的模型开放和配套工具不是一回事。发布说明采用分批开放安排,账号是否可用、所在地区是否支持,以及能否操作软件,都应以实际服务和权限为准。[1] 看见别人演示成功,不代表自己的环境已经准备好了。
真要长期使用,可以给自己留一个简单的记录:原来这件事要花多久,现在算上检查和修改又要多久。没有省下时间,就回头看看,是任务选得不合适,资料没给全,还是当前工具确实做不到。
我认为,GPT6代表的这类能力,有望推动一轮生产力革命。过去,一个小团队想做数据分析、搭建工具、制作设计初稿,往往要在几种软件和不同人员之间反复协调。如果AI能把其中一段完整工作接下来,人的时间就能更多地用在确定需求、判断方案和检查结果上。
变化还可能发生在那些以前根本没做的事情上。一个工具因为开发成本太高,一直搁着;几种设计方案因为时间不够,只试了第一种。尝试成本降下来之后,更多想法才有机会做出来。这个影响,比一封邮件写快几分钟更值得关注。
当然,这不是GPT6一发布,所有岗位就立刻换一种做法。成本、可靠性、数据权限和后续维护,都决定了它能走多远。普通人可以先从手头一件熟悉的工作开始,看看它究竟省下了多少操作,又留下了多少需要自己判断的事情。
参考资料
资料核对日期:2026年9月6日。文中区分官方演示、厂商资料和应用建议;具体功能及开放范围以实际版本为准。
[1] OpenAI:GPT-6 Astra发布介绍与官方演示
https://openai.com/index/gpt-6-astra/
[2] ChatGPT Learn:文件分析、工作交付与学习应用
https://learn.chatgpt.com/
[3] OpenAI技术文档:Computer use
https://developers.openai.com/api/docs/guides/tools-computer-use
[4] ChatGPT Sites:网站、网页应用和游戏的创建与分享
https://learn.chatgpt.com/docs/sites?surface=app
[5] OpenAI案例:Playco使用GPT-6 Astra进行游戏原型开发
https://openai.com/index/playco-game-prototyping-with-astra/
[6] 薪火科技:AI边缘计算盒子产品资料(厂商资料)
https://www.xinhuokj.com/products/ai-edge-box.html
[7] 多模态告警二次核验的部署方法(厂商技术资料)
https://www.xinhuokj.com/guides/multimodal-alarm-verification.html
[8] OpenAI模型指南:GPT-6 Astra的新能力与上一代已有能力
https://developers.openai.com/api/docs/guides/latest-model?model=gpt-6-astra
[9] ARC Prize:GPT-6 Astra核验成绩及不同运行框架的结果
https://arcprize.org/results/openai-gpt-6-astra
[10] ARC Prize:GPT-6 Astra在ARC-AGI-3中的表现与测试方法
https://arcprize.org/blog/astra