有人以为Scaling Law是万能公式,其实它更像天气预报——参数翻倍效果未必翻倍,但总归会有点提升。关键问题在于,当模型大到某个临界点,继续砸钱训练可能收效甚微。就像煮粥,火候到了再熬只会糊锅,这时候得换新锅而不是加柴火。 腾讯云吴运声在WAIC上点破现状:业内分成两派,一派坚信规模为王,另一派开始寻找新路径。但现实哪有非黑即白?就像开车上高速,既不能只看导航不管路况,也不能完全放弃路线规划。真正的解法是边跑边调,把理论规律和工程实践拧成一股绳。现在有些团队已经转向优化数据质量、改进训练方法,这些实打实的改进可能比单纯堆参数更有效。