近期国产大模型整体处于沉潜蓄势阶段,表面平静之下实则酝酿着新一轮技术跃升。业内普遍预期,智谱即将推出的下一代大模型将命名为GLM-5.4或GLM-5.5,相较当前版本将实现显著突破。
智谱创始人唐杰在新加坡的一场公开演讲中系统阐述了该系列模型的研发重点,聚焦三大方向。其一为预训练阶段的全面升级:训练数据规模将拓展至数万亿token量级,参数量预计突破一万亿,较现有7400亿参数模型实现跨越式增长。更大规模的数据与参数构成更高智能上限的基础支撑。
其二为后训练能力的深度强化。智谱在强化学习后训练领域长期保持领先优势,此次将在GLM-5.4/5.5中进一步优化监督微调、基于人类反馈的强化学习以及基于验证反馈的强化学习等关键环节,持续夯实模型对齐能力与任务泛化水平。
其三为长程推理与智能体能力的实质性进阶。模型将面向更复杂环境、更困难任务及更长执行周期进行设计,赋予其更充分的思考纵深与操作自主性,加速向具备持续规划与多步决策能力的长程智能体演进。
唐杰指出,当前通用大模型在对话交互与代码生成等基础能力上已趋成熟,GLM-5.4/5.5的演进路径将转向两个更具前沿性的方向:一是探索递归式自我改进机制,即模型在训练全流程中逐步实现自我驱动、自我修正与自我优化;二是构建更具延展性与自主性的智能体架构,支持跨时段、跨场景、跨任务的连贯执行。
此前在八月下旬的业绩说明中,唐杰已提出“完全自训练”构想,其核心内涵与国际学界所称RSI(递归自我改进)高度一致,即模型能够独立完成预训练、中间训练及后训练全周期迭代,并具备持续进化能力。这一构想的关键挑战在于赋予模型对训练进程的元认知能力——准确判断何时收敛、何时纠偏、何时重启,而非仅依赖算力堆叠与流程延展。相关技术路径目前仍处于原理验证与模块化落地阶段。
需要说明的是,该构想的完整实现预计指向后续的GLM-6代际产品,而GLM-5.4/5.5将率先集成部分RSI能力组件,迈出从人工主导向人机协同演进的重要一步。

评论
更多评论