第(2/3)页 这两个问题,在2016年这个全球AI界连大模型门槛都没摸到的时间节点,确实是绝症。 没有任何论文可以参考,没有任何开源代码可以借鉴。 但在后世那个百模大战、大模型开源烂大街的2024年,这不过是教科书级别的新手问题。 如果没有前世的记忆,仅凭九天现有的这群天才,哪怕有雅安无尽的算力支撑,他们至少要在黑暗中摸索七到八个月,才能靠海量的试错堆出一个勉强可用的方案。 但是顾屿站在这里,“标准答案”就在这里。 “你们给奖励模型的权力太大了,模型更新的步子也跨得太宽。” 顾屿转过身,手中的马克笔在白板上迅速写下一行全新的数学推导公式。 “在PPO算法更新参数的时候,你们不能让模型像脱缰的野马一样为了讨好奖励模型而乱跑。必须引入一个参考模型,也就是你们做微调之前的那个初始底座模型。”顾屿条理清晰地抛出解法, “每次新模型生成回答,不仅要看奖励模型给多少分,还要实时计算它和初始模型在词元输出概率上的分布差异。” 顾屿转头看向楼天城,给出了一个形象的比喻。 “打个比方,初始模型就像一个博览群书但口无遮拦的学者,它有自己正常的说话习惯和用词规律。当它为了迎合打分系统,开始满嘴车轱辘废话或者疯狂堆砌政治正确词汇时,它的语言分布就会发生剧变。我们要做的,就是用数学工具去量化这种变化带来的偏差。” 顾屿手中的笔尖顺着公式滑动: “如果生成的回答偏离初始模型太远,偏差过大,就直接在最终奖励里进行大幅度扣分惩罚。逼着它既要回答人类想听的,又绝对不能偏离原本正常的语言逻辑规律。” 顾屿停下笔,目光扫过实验室里的众人: “在信息论和概率统计里,衡量两个概率分布之间差异的这把标尺,全称叫做KUllbaCk-Leibler divergenCe,也就是库尔贝克-莱布勒散度。” 顾屿手臂发力,笔尖重重地在公式尾端写下两个大写字母。 “给它加入KL散度惩罚项。”顾屿敲击着白板, “这样就能彻底锁死奖励黑客的漏洞。” 任少卿推了一下眼镜,盯着那个加上了KL惩罚项的方程。 楼天城从椅子上直接蹦了起来。 “对啊!拉住它的缰绳!” “不仅要奖励它的讨好,还要惩罚它的过度变化。数学逻辑完全闭环,工程上绝对可行!” 林远站在后方,大脑飞速运转,他完全听懂了顾屿提出的这个概念。 极其精妙。只需在现有代码架构里增加不到两百行的损失函数计算模块,就能彻底解决困扰顶级团队半个月的逻辑死局。 “那灾难性遗忘呢?”任少卿急切追问。 “更好解决。”顾屿将白板翻了个面,画出两个数据池交汇的草图, 第(2/3)页