苹果公司正对人工智能初创企业PrismML研发的模型量化技术展开深入评估。该技术可将大型语言模型所需的内存资源由约54GB压缩至4GB以内。
PrismML的关键创新在于其原生1比特模型压缩方法,可将模型体积缩减至全精度版本的约七分之一,内存占用减少逾九成。在精度方面,压缩后模型仍能维持接近半精度浮点数(FP16)的性能表现,同时显著加快推理响应速度并降低设备功耗。
近期,PrismML正式发布Bonsai 27B模型。该模型基于Qwen 3.6 27B架构进行优化微调,在保持原有智能水平约九成的前提下,已实现在配备12GB运行内存的iPhone 15及后续机型上本地部署并完整运行270亿参数规模的语言模型。

评论
更多评论