文章摘要
当前大模型后训练领域存在相关研究零散、缺乏串联各环节完整落地链路资料的普遍痛点,为此推出Nathan Lambert撰写的免费RLHF专业书籍,该书拆解完整后训练流程,配套代码库、课程与工具库,网页版持续更新,近期新增相关技术内容,可通过指定链接获取。

很多从事大模型后训练相关工作的从业者,大多都曾遇到过这样的困扰:相关的学术研究论文数量繁多且内容零散,监督微调、奖励模型训练、拒绝采样、强化学习对齐、OPD、直接对齐等各个环节都有大量独立研究成果,但很少有资料能将这些环节串联成一套完整的落地链路。

针对这一行业普遍存在的痛点,目前推出了一本完全免费的专业书籍,由Nathan Lambert撰写的《Reinforcement Learning from Human Feedback》。

这本书从RLHF的起源开始讲起,按照行业通用的标准技术配方逐段拆解完整的后训练流程;除了书籍本身外,还配套了专属的代码库、系统学习课程,以及一个可以对比不同后训练阶段模型输出效果的工具库。

目前该书籍的网页版还在持续更新迭代,最近刚刚补充了MOPD与智能体导向后训练相关的技术配方内容。

想要获取这份资料的读者,可以通过以下链接进行访问:https://qingkelab.github.io/ppt/?file=external%2Fsubmissions%2Fissue-1%2Fbook.pdf

以上内容不代表本平台立场,仅供读者参考