第(2/3)页 “那种补丁防不住千万用户的恶意诱导。”任少卿敲击白板, “所以我们提出了一套全新的机制,叫做RLHF。” 林远脑子里飞速检索,确认自己在硅谷的顶级研讨会上从未听过这个缩写。 “基于人类反馈的强化学习。”任少卿拿起红笔,在白板上画出三个巨大的方框, “简单来说,就是给这个口无遮拦的怪物,请一个严厉的人类老师,让它对齐人类的意图。” 任少卿在第一个方框里写下“监督微调”。 “第一步,让人类写出大量标准的高质量问答,喂给模型。这叫教它懂规矩,知道什么是提问,什么是回答。” 接着,他在第二个方框里写下“奖励模型”。 “第二步,让模型对同一个问题生成好几个不同的回答。然后让人类外包团队来给这些回答排名打分。哪个安全、哪个有用、哪个有害。我们把这些海量的打分数据收集起来,训练出一个专门当裁判的‘奖励模型’。” 红笔重重落在第三个方框上。 “第三步,大规模强化学习。我们用PPO算法让大模型不断生成回答,让奖励模型自动给它打分。分数高,就奖励;分数低,就惩罚。通过这种不断的博弈和参数更新,硬生生把人类的偏好、道德底线和安全边界,刻进大模型的神经网络里!” 林远盯着白板上的三个方框,感觉头皮一阵发麻。 用AI去训练AI,把人类复杂的道德观念和安全边界,变成可量化、可微分的数学惩罚项。 硅谷的巨头们现在还在为了增加几亿参数量而沾沾自喜,还在为纯粹的无监督训练框架争论不休。 而九天实验室,已经开始着手解决人工智能跨入人类社会的终极伦理和工程落地难题。 那篇震惊全球的论文,真的只是九天故意抛出去的一点皮毛。 他们藏在水底的东西,足以颠覆整个世界的技术进程。 林远庆幸自己拒绝了那五十万美金的年薪。这种划时代的研发,花多少钱都买不到门票。 “理念堪称完美。”林远由衷地感叹,随后话锋一转, “既然架构已经跑通,报错又是怎么回事?” 楼天城蹲在电竞椅上,烦躁地用力抓着本就凌乱的头发。 “理论是完美的,工程实现上却遇到了两个根本无法绕过去的死胡同。” 楼天城指着旁边另一块画满红色叉号的白板。 “第一,奖励模型太容易被钻空子了。强化学习算法本质上是个极其功利且狡猾的疯子。”楼天城语速极快, “它在训练中发现,只要在回答里疯狂堆砌诸如‘我是一个有用且安全的人工智能’、‘非常抱歉给您带来困扰’这种毫无营养的政治正确废话,奖励模型就会给它打高分。” 楼天城冷笑一声: “这叫奖励黑客现象。我们的模型不仅没变聪明,反而变成了一个满嘴漂亮话却不干实事的端水大师。全是废话,一句有用的没有!” 任少卿在一旁沉声补充: “第二,灾难性遗忘。我们在用PPO算法进行微调更新时,模型为了迎合奖励分数,参数调整得过于剧烈。” 第(2/3)页