GPT-4混合大模型?研究证明MoE+指令调优确实让大模型性能超群
机器之心报道
编辑:小舟、陈萍
谷歌、UC 伯克利等证明 MoE + 指令调优起到了 1 + 1 > 2 的效果。
自 GPT-4 问世以来,人们一直惊艳于它强大的涌现能力,包括出色的语言理解能力、生成能力、逻辑推理能力等等。这些能力让 GPT-4 成为机器学习领域最前沿的模型之一。然而,OpenAI 至今未公开 GPT-4 的任何技术细节。
上个月,「天才黑客」乔治・霍兹(George Hotz)在接受一家名为 Latent Space 的 AI 技术播客的采访时提到了 GPT-4,并称 GPT-4 其实是一个混合模型。具体来说,乔治・霍兹称 GPT-4 采用由 8 个专家模型组成的集成系统,每个专家模型都有 2200 亿个参数(比 GPT-3 的 1750 亿参数量略多一些),并且这些模型经过了针对不同数据和任务分布的训练。

Latent Space 的采访内容。
这或许只是乔治・霍兹的一种推测,但这种模式确实有一定的合理性。最近,由来自谷歌、UC 伯克利、MIT 等机构的研究者联合发表的一篇论文证实:混合专家模型(MoE)与指令调优的结合能够让大型语言模型(LLM)的性能大幅提升。

论文地址:https://arxiv.org/pdf/2305.14705.pdf
稀疏混合专家模型是一种特殊的神经网络架构,可以在不增加推理成本的情况下,为大型语言模型(LLM)增加可学习的参数。指令调优(instruction tuning)是一种训练 LLM 遵循指令的技术。该研究发现 MoE 模型比密集模型更能从指令调优中获益,因此提出将 MoE 和指令调优结合起来。
该研究在三种实验设置下进行了实证研究,包括
在没有指令调优的情况下在单个下游任务进行直接微调;指令调优后对下游任务进行 in-context 少样本或零样本泛化;指令调优后对单个下游任务进行进一步微调。在第一种情况下,MoE 模型总体上不如具有相同计算能力的密集模型。然而,随着指令调优的引入(第二和第三种情况),FLAN-MoE_32B(Fine-tuned LAnguage Net,简写为 Flan,是一种经过指令调优的模型,Flan-MoE 即为指令调优 MoE)在四个基准任务上性能超过了 FLAN-PALM_62B,却只用了三分之一的 FLOPs。
如下图所示,在使用指令调优前,MoE→FT 不如 T5→FT。指令调优后,Flan-MoE→FT 优于 Flan-T5→FT。MoE 从指令调优中获得的收益 (+15.6) 大于密集模型 (+10.2):

看来 GPT-4 采用混合模型还是有点根据的,MoE 确实能够从指令调优中获得更大的收益:

方法概述
研究者在 FLAN-MOE (是一组经过指令微调的稀疏混合专家模型)模型中使用了稀疏激活 MoE(Mixture-of-Experts)。此外,他们还用 MoE 层替换了其他 Transformer 层的前馈组件。
每个 MoE 层可理解为一个「专家」,然后,使用 softmax 激活函数对这些专家进行建模,得到一个概率分布。
尽管每个 MoE 层有很多参数,但专家是稀疏激活的。这意味着对于给定的输入 token,只使用有限的专家子集就能完成任务,从而为模型提供了更大的容量。
对于具有 E 个专家的 MoE 层,这实际上提供了 O (E^2) 种不同的前馈网络组合,从而实现了更大的计算灵活性。
由于 FLAN-MoE 是经过指令调优的模型,因而指令调优非常重要,该研究在 FLAN 集合数据集的基础上对 FLAN-MOE 进行微调。此外,该研究将每个 FLAN-MOE 的输入序列长度调整为 2048,输出长度调整为 512。
实验与分析
平均而言,在不增加任何额外计算的情况下,Flan-MoE 在所有模型尺度上都优于密集的同类产品 (Flan-T5)。

专家数量。图 4 显示,随着专家数量的增加,初始时,模型受益于更丰富的专门子网络,每个子网络能够处理问题空间中的不同任务或方面。这种方式使得 MoE 在处理复杂任务时具有很强的适应性和效率,从而整体上改善性能。然而,随着专家数量的不断增加,模型性能增益开始减少,最终达到饱和点。

图 3 和表 1 详细研究了不同的路由决策如何影响指令调优性能:通过 FLAN-Switch 和 FLAN-GS 策略之间的比较可以得出,激活更多的专家会在四个基准测试中提高性能。在这些基准测试中,MMLU-Direct 模型显示出最显著的改进,对于 BASE/LARGE 尺寸的模型,从 38.0% 增加到 39.9%。
值得注意的是,与等效容量的密集模型相比,指令调优显著放大了 MoE 模型在保留 MMLU、BBH 和内部 QA 和推理基准测试方面的性能。对于较大的 MoE 模型,这些优势进一步放大。例如,指令调优使 ST_32B 的性能提升了 45.2%,而对于 FLAN-PALM_62B,这种改进相对较小,约为 6.6%。

当进行模型扩展时,Flan-MoE (Flan-ST-32B) 优于 Flan-PaLM-62B 。

此外,该研究通过 freeze 给定模型的门控函数(gating function)、专家模块和 MoE 参数进行了一些分析实验。如下表 2 所示,实验结果表明,freeze 专家模块或 MoE 组件对模型性能有负面影响。

相反,freeze 门控函数会使模型性能略有改善,尽管并不明显。研究者推测这一观察结果与 FLAN-MOE 的欠拟合有关。该研究还进行了消融实验来探究下图 5 描述了微调数据效率消融研究。

最后,为了比较直接对 MoE 进行微调和 FLAN-MOE 之间的差距,该研究对单任务微调的 MoE、单任务微调的 FLAN-MoE 和密集模型进行了实验,结果如下图 6 所示:

感兴趣的读者可以阅读论文原文,了解更多研究内容。
大家都在看
-
《疯狂动物城》为什么好看?这里有我们爱看拟人化动物的科学解释 编者按童年的动画片里,藏着我们最初的好奇心。那些看似夸张的情节,其实常常连着真实世界的自然规律与科学原理。《童年动画大科普》系列,带你重新审视这些陪伴过我们的经典角色:哪些设定源自真实生物学?哪些桥段 ... 机械之最12-08
-
马斯克的脸装在机械犬上?这才是巴塞尔艺术节最“疯”的作品! 迈阿密巴塞尔惊现亿万富翁机械犬。艺术圈最会制造冲击的艺术家Beeple这次带来的装置作品Regularanimals(普通动物)成为全场焦点。走进展厅会看到一个像斗兽场的围栏,里面几只机械犬来回巡逻,里面不是动物而是一群带 ... 机械之最12-08
-
人在去世之前,为什么会“灵魂出窍”? 早上醒来刷手机停不下来,明明要减肥却忍不住开炫奶茶,看到熟悉的人却叫不出名字,被老板批评后一整天都emo……这些日常场景是不是像极了你的生活?你有没有好奇过:为什么我们的大脑总在“叛逆”?为什么明明知道 ... 机械之最12-08
-
“羊圈超市”成“金子做的碗”!看玉树甘达的兴业密码 原标题:甘达村里话振兴甘达村村民领取村集体经济收益分红物资。土 登摄(人民视觉)初冬,青藏高原青海玉树市的山坡上,太阳照射下,一排排金色的屋顶错落有致,好似镶在藏袍上的蜜蜡,格外引人注目,这就是甘达村 ... 机械之最12-08
-
“小灶大锅”存隐患 使用卡式炉注意三大安全“陷阱” 正值寒冷冬季不少人会选择使用免插电的卡式炉来一顿热气腾腾的火锅暖胃又暖心但你知道看似便捷的卡式炉竟也暗藏危险吗?11月30日,山东烟台,三名男子聚餐时用卡式炉煮火锅,在调试火力时,一股强气流突然把锅掀翻, ... 机械之最12-06
-
“全网最忙五人组”背后有什么猫腻? 不以姓氏笔画排序的百度文库《10000中国普通人名大全》正引发各方高度关注。这些名字被用在政府采购公告的评审小组“组建”,也在一些比赛的获奖名单中“凑数”,还出现在了一份行政处罚公示信息里。其中的“张吉惟 ... 机械之最12-06
-
一不小心吃着吃着就炸了!使用不当卡式炉竟成了 “餐桌炸弹” 正值寒冷冬季不少人会选择使用免插电的卡式炉来一顿热气腾腾的火锅暖胃又暖心但你知道看似便捷的卡式炉竟也暗藏危险吗?11月30日,山东烟台,三名男子聚餐时用卡式炉煮火锅,在调试火力时,一股强气流突然把锅掀翻, ... 机械之最12-06
-
傻眼!这些获奖名单、评审名单,都是直接复制“人名大全”? 近日,一政府采购评审名单被指照搬人名大全,引发关注。中国政府采购网12月3日公布的湖北十堰《竹溪县住房和城乡建设局本级机械设备租赁采购中标(成交)结果公告》评审成员名单中,5位评审名字与百度文库“10000中国 ... 机械之最12-06
-
一天1000多斤!很多人爱吃,有人天没亮就去排队 清晨七点不到合肥菜市场的肉铺前已人流不断冬意渐浓灌香肠、晒腊肉成为不少家庭的“入冬仪式”大街小巷的阳台上一串串油润的香肠渐渐挂满年味就在这浓郁的腊香中悄然升腾市场一早排起长龙12月3日清晨六点多,天还未 ... 机械之最12-06
-
柳工集团荣登2025年“世界一流机械企业500强”和“中国机械500强”双榜单 (来源:21sun工程机械商贸网)12月4日,2025年中国机械500强研究报告发布会在江苏苏州举行。柳工集团凭借卓越的综合实力与市场表现,成功斩获“2025年世界一流机械企业500强”“2025年中国机械500强”两项殊荣。柳 ... 机械之最12-06
相关文章
- 向未来生长——台州制造的跃迁与再造
- “羊圈超市”成“金子做的碗”!看玉树甘达的兴业密码
- A股工程机械板块谁是最具潜力的投资标的?
- “小灶大锅”存隐患 使用卡式炉注意三大安全“陷阱”
- “全网最忙五人组”背后有什么猫腻?
- 一不小心吃着吃着就炸了!使用不当卡式炉竟成了 “餐桌炸弹”
- 傻眼!这些获奖名单、评审名单,都是直接复制“人名大全”?
- 一天1000多斤!很多人爱吃,有人天没亮就去排队
- 柳工集团荣登2025年“世界一流机械企业500强”和“中国机械500强”双榜单
- 碾压时代的战争机器:解析二战初期德军何以登顶全球陆军巅峰
- 最后的短板机械硬盘
- “全网最忙五人组”曝光!两份名单,都是照搬“人名大全”?
- 百慕大三角全解!这究竟是世纪骗局还是未解之谜?
- 消费新视野丨新供给创造新需求 智能穿戴产品打开千亿市场空间
- 雷神猎刃S、机械革命极光X、蛟龙16P:谁才是性价比天花板?
- 四中全会精神解读·市场最前沿丨从“流水线”到“定制线”,纺织行业迎来数智蝶变
- 卖车的理想,用AI眼镜试探“具身智能”
- 记者手记:让AI的光照亮每个需要被温暖的角落
- 2026年值得期待的十大技术应用都有啥?
- 从“榨糖”到“超级电容” 揭秘广西甘蔗的甜蜜产业链
热门阅读
-
天下第一暗器暴雨梨花针,传说中的唐门暗器做出来了 07-13
-
世界十大大型船舶排名,第一能承重六十万吨! 07-13
