人工智能

335亿元砸下去,智谱力推AI自己训练自己

作者: 来源: 文章标签:智谱RSI自进化

AI“六小虎”之一智谱再获珠海5亿元投资将建城市级大模型空间

文|春妮  「思聪网」 TechGG.com

智谱又融资了。

但这一次,真正值得关注的不是它又拿到了多少钱,而是这335亿元准备拿去干什么

9月12日,智谱公布新一轮融资计划,拟配售新H股,并发行201.4亿元人民币零息可转债,两项融资预计净募资约393亿港元,折合人民币超过330亿元。

对于一家今年1月才登陆港股的大模型公司来说,这已经是一笔相当惊人的融资。

更值得注意的是,智谱给出了非常明确的资金用途:约60%的钱,也就是235亿港元左右,将投向下一代GLM基础模型、“完全自训练”体系,以及训练、推理和算力基础设施。

看到这里,问题就来了。

GLM-6.0到底准备做什么,值得智谱砸下这么多钱?

答案藏在一个新词里:

完全自训练。

如果把这个词翻译成普通人能够听懂的话,就是一句话:

智谱想让AI开始参与训练AI。

这次,AI不只是被训练的对象

过去几年,大模型公司的竞争逻辑其实非常简单。

找更多数据,买更多算力,训练更大的模型,然后再通过后训练把模型能力往上推。

但这种模式正在碰到越来越明显的天花板。

算力当然可以买,但高质量数据越来越难找;人工标注可以扩大,但很难无限扩大;而当模型开始进入Agent阶段,训练任务本身也越来越复杂。

让一个AI回答一道数学题,并不算特别困难。

但如果让它真正完成一项工作,就完全不同了。

它可能需要先搜索资料,再写代码,再调用工具,再运行程序,发现错误后重新修改,最后还要验证结果。

这种任务如果全部靠人类设计、人工标注,成本会越来越高。

于是,AI行业开始出现一个非常诱人的想法:

既然模型已经会写代码、会解决问题、会判断结果,为什么不能让它自己制造训练自己的“教材”和“考题”?

智谱这次显然准备认真试一试。

按照公告披露的路线,下一代GLM会在上一代模型搭建的环境中继续训练。模型可以通过自我对弈、规则校验、执行验证、模型评审等方式产生和筛选训练数据,再把这些数据重新投入训练。

也就是说,以前是人类给模型准备数据,现在模型自己也开始参与生产数据。

更进一步,智谱还希望让智能体自己创造训练环境。

比如给AI设计一个复杂任务,让它自己尝试完成;完成过程中发现问题,就生成新的验证器;如果任务太简单,就提高难度;如果任务根本无法完成,就修改环境。

这样一来,训练环境本身也可以不断增加。

AI不仅自己做题,还开始自己出题。

这才是“完全自训练”真正有意思的地方。

但智谱显然还不满足于此。

公告里还有一个更大胆的方向:让模型参与优化训练和推理基础设施。

模型已经越来越会写代码,那么就让它帮助优化算子、内核、调度、缓存、通信和服务栈。

换句话说,过去是人类工程师负责建造“训练AI的机器”,以后可能让AI参与改进这台机器。

如果把这些事情串起来,就会出现一个非常有意思的循环:

AI生产数据,AI创造训练环境,AI帮助优化训练系统,然后这些东西再用来训练下一代AI。

这就是智谱所说的递归式自我改进。

而GLM-6.0,很可能就是这套思路第一次真正大规模落地的尝试。

所以,智谱为什么突然需要这么多钱?

现在再回头看这335亿元,逻辑就清楚了。

智谱并不是简单地想再训练一个更大的模型。

它想搭的是一套新的模型生产体系。

这套体系首先需要大量算力。

智谱在公告中明确提到,将继续采购和租赁算力资源,同时投入芯片适配、算子开发、集群互联和性能调优,并建设自研推理引擎和服务栈。

这里面有一个很容易被忽略的变化。

过去大模型公司买算力,主要是为了训练模型。

但如果模型本身开始参与生产数据、生成任务、运行验证,那么训练本身也会变成一个持续不断的过程

模型越强,可以创造的任务越复杂;任务越多,需要的训练算力就越大;训练出来的新模型更强之后,又可以创造更多任务。

所以,智谱现在真正需要的,不只是一次训练所需要的算力,而是一套能够长期运转的算力和基础设施。

这也是为什么这轮融资规模会这么大。

实际上,智谱最近的融资速度本身就已经非常快。

今年1月上市时,智谱净募资约49亿港元;7月又完成一次配售,净募资约314亿港元;再加上这一次,上市不到9个月,累计净募资已经达到约755亿港元。

这已经不是一家创业公司在为下一款产品筹钱那么简单。

智谱正在用资本市场的钱,押注下一阶段大模型的发展方式。

但“AI训练AI”,最难的恰恰不是训练

当然,这件事情真正值得关注的地方,也不是智谱把概念说得多漂亮。

而是它能不能真的跑通。

因为“让AI自己生成数据”并不难,难的是怎么判断它生成的数据是不是好数据

模型可以自己出题,但怎么证明题目有价值?

模型可以自己做题,但怎么证明它给出的答案不是错的?

模型可以自己写代码优化训练系统,但如果它犯了错误,会不会把错误进一步放大?

这才是递归式自我改进最大的风险。

如果一个模型不断使用自己生成的数据训练自己,却缺少可靠的外部验证机制,那么它可能不是越来越聪明,而是在不断强化自己的偏差。

所以智谱在公告中专门强调了规则校验、执行验证、模型评审以及人工抽检。

这几个词其实非常关键。

它说明现阶段所谓“完全自训练”,并不是人类彻底退出。

恰恰相反,人类可能正在从“亲自给AI喂数据”,变成设计规则、建立验证体系,然后监督AI自己跑起来

如果这一套机制最终能够成立,那么大模型行业可能会出现一个很大的变化。

过去,模型能力增长依赖人类不断提供新的数据和算力。

未来,模型可能开始帮助自己获得下一轮训练所需要的数据、任务和工具。

这才是真正意义上的Scaling。

所以,335亿元真正押注的并不是一个GLM-6.0的参数规模,也不是一次Benchmark排名。

智谱赌的是另一件事情:

AI能不能从一个被人训练的对象,逐渐变成一个能够帮助人类训练下一代AI的“研发伙伴”。

如果能,这可能改变大模型的迭代速度。

如果不能,那么这335亿元,最终可能只是又一次昂贵的算力竞赛。

而这,才是GLM-6.0最值得看的地方。

它到底能不能让AI真正开始训练AI?

智谱已经把钱砸下去了。

现在,就等答案。

收藏文章

评论交流