8月6日晚消息,有消息称字节跳动正就训练一个参数量超过五万亿的大语言模型展开内部讨论。该模型参数规模将显著超越当前国内已公开的同类模型,包括阿里研发的Qwen 3.8-Max(参数量约二点四万亿)以及月之暗面推出的K3(参数量约二点八万亿),若最终落地,将成为国内已知参数规模最大的大模型。目前该项目尚处于早期探索阶段,尚未确定是否正式对外发布。
该项目由Seed Foundation负责人项亮牵头推进,并与大语言模型预训练数据负责人沈科协同开展。为支撑这一目标,Seed团队正在对现有组织架构进行系统性梳理,进一步明确职责分工,优化资源配置。
项亮与沈科均为字节跳动人工智能及大模型研发体系中的关键骨干,均成长于公司搜索、广告与推荐技术体系。项亮本科就读于中国科学技术大学,后于中国科学院自动化研究所攻读博士学位,2016年加入字节跳动,曾主导机器学习中台AML团队建设,后续出任豆包大模型Foundation团队负责人。沈科2018年自清华大学毕业后加入字节跳动,长期专注于大语言模型预训练数据的构建与治理工作。
据接近Seed团队的相关人士透露,团队提出大幅跃升参数规模的构想,核心考量在于:与其在既有模型尺寸上持续跟进同行,不如以量级优势实现突破,在关键指标上争取结构性领先。

评论
更多评论