运营热点解读
只用一张卡,做出了声称是100M参数以内最好的小模型?
雷达摘要
独立开发者Harshal Singh发布35M参数的BarunLM基础语言模型,声称是100M以内最好的模型。该模型采用局部与全局注意力交替设计(3:1比例),仅用单张H200 GPU训练,在九项零样本基准测试中平均准确率达41.01%,超越参数量为其6.55倍的LFM2.5-230M-Base等更大模型。模型已开源。
原始信息
本页是基于公开来源生成的摘要与运营提示,不替代原文。请以原始发布方内容为准。
电商热点雷达运营热点解读
独立开发者Harshal Singh发布35M参数的BarunLM基础语言模型,声称是100M以内最好的模型。该模型采用局部与全局注意力交替设计(3:1比例),仅用单张H200 GPU训练,在九项零样本基准测试中平均准确率达41.01%,超越参数量为其6.55倍的LFM2.5-230M-Base等更大模型。模型已开源。
本页是基于公开来源生成的摘要与运营提示,不替代原文。请以原始发布方内容为准。