设置
  • 日夜间
    随系统
    浅色
    深色
  • 主题色

58行代码把Llama 3扩展到100万上下文,任何微调版都适用

2024-05-08 09:13:13 来源: 量子位

大模型进入组装时代uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

堂堂开源之王Llama 3,原版上下文窗口居然只有……8k,让到嘴边的一句“真香”又咽回去了。uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

在32k起步,100k寻常的今天,这是故意要给开源社区留做贡献的空间吗?uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

开源社区当然不会放过这个机会:uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

现在只需58行代码,任何Llama 3 70b的微调版本都能自动扩展到1048k(一百万)上下文。uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

背后是一个LoRA,从扩展好上下文的Llama 3 70B Instruct微调版本中提取出来,文件只有800mbuqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

接下来使用Mergekit,就可以与其他同架构模型一起运行或直接合并到模型中。uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

所使用的1048k上下文微调版本,刚刚在流行的大海捞针测试中达到全绿(100%准确率)的成绩。uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

不得不说,开源的进步速度是指数级的。uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

1048k上下文LoRA怎么炼成的

首先1048k上下文版Llama 3微调模型来自Gradient AI,一个企业AI解决方案初创公司。uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

而对应的LoRA来自开发者Eric Hartford,通过比较微调模型与原版的差异,提取出参数的变化。uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

他先制作了524k上下文版,随后又更新了1048k版本。uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

首先,Gradient团队先在原版Llama 3 70B Instruct的基础上继续训练,得到Llama-3-70B-Instruct-Gradient-1048k。uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

具体方法如下:uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

  • 调整位置编码:用NTK-aware插值初始化RoPE theta的最佳调度,进行优化,防止扩展长度后丢失高频信息
  • 渐进式训练:使用UC伯克利Pieter Abbeel团队提出的Blockwise RingAttention方法扩展模型的上下文长度

值得注意的是,团队通过自定义网络拓扑在Ring Attention之上分层并行化,更好地利用大型GPU集群来应对设备之间传递许多KV blocks带来的网络瓶颈。uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

最终使模型的训练速度提高了33倍。uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

长文本检索性能评估中,只在最难的版本中,当“针”藏在文本中间部分时容易出错。uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

有了扩展好上下文的微调模型之后,使用开源工具Mergekit比较微调模型和基础模型,提取参数的差异成为LoRA。uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

同样使用Mergekit,就可以把提取好的LoRA合并到其他同架构模型中了。uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

合并代码也由Eric Hartford开源在GitHub上,只有58行。uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

目前尚不清楚这种LoRA合并是否适用于在中文上微调的Llama 3。uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

不过可以看到,中文开发者社区已经关注到了这一进展。uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

524k版本LoRA:
https://huggingface.co/cognitivecomputations/Llama-3-70B-Gradient-524k-adapteruqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

1048k版本LoRA:
https://huggingface.co/cognitivecomputations/Llama-3-70B-Gradient-1048k-adapteruqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

合并代码:
https://gist.github.com/ehartford/731e3f7079db234fa1b79a01e09859acuqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

参考链接:
[1]https://twitter.com/erhartford/status/1786887884211138784uqA流量资讯——探索最新科技、每天知道多一点LLSUM.COM

本文链接:58行代码把Llama 3扩展到100万上下文,任何微调版都适用http://www.llsum.com/show-2-5684-0.html

声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇: 上海期智研究院全球招人才!人工智能/信息安全/量子智能方向的来

下一篇: 《嬛嬛朕emo啦》但马斯克!阿里这项技术开放试玩

热门资讯

  • 我国成功研制可靶向送药的磁驱软体机器人

    中国科学院深圳先进技术研究院15日发布消息称,该院科研团队研发了一种具有靶向送药功能的磁驱软体机器人,该机器人能够根据器官内部环境的特点选择合

  • 站在“人工智能+”探索前列

    今年全国两会期间,人工智能成为热点话题,“人工智能+”首次被写入政府工作报告。一头连着数字经济发展大局,一头连着行业变革与创新,“人工智能+”既是

  • 新AI系统可提供足球制胜战术

    未来的足球场,人工智能(AI)当“大脑”?《自然·通讯》19日发表一项来自谷歌深度思维的最新成果,研究团队报告了一个名为“TacticAI”的系统,能在足

  • 我国首个适应高寒气候肉羊品种通过鉴定

    记者19日从兰州大学获悉,天华肉羊通过国家畜禽遗传资源委员会审定鉴定,成为我国首个适应高寒气候的肉羊品种。该品种由兰州大学草地农业科技学院李发

  • AI领域,重磅消息传来!

    AI领域,一则重磅消息传来!最新消息,全球最知名的AI公司——OpenAI将在几个月内发布新版大型语言模型GPT-5,性能将有大幅跃升。目前,ChatGPT使用

  • 新疗法可有效治疗多发性骨髓瘤

    据埃菲社报道,多发性骨髓瘤是成年人中继淋巴瘤之后第二常见的血液肿瘤。最近,西班牙的一个科研团队开发出了一种新的免疫疗法来对抗它。实验室实验表

  • 世界睡眠日:别让你的良好睡眠被手机夺走

    再打一局游戏就睡,再刷几个视频就睡,终于放下手机,关灯睡觉了……结果翻来覆去睡不着,半夜醒来再也睡不着,为什么明明睡着了,睡眠质量却不高

  • 2999元!卢伟冰:xiaomiCivi 4 Pro可能是2024年最轻薄的电话

    3月22日消息,xiaomi集团的卢伟冰在微博上表示,xiaomiCivi 4 Pro有可能是2024年最轻薄的电话。这款电话的厚度仅为7.45mm,重量为179.3g。尽管拥有超轻薄的

  • iPhone总裁库克访问中国:女子手持huaweiMate60与其合影

    3月25日消息,国内一场经济高峰论坛上,iPhone总裁蒂姆·库克再次成为焦点。然而,引起人们关注的并非库克的讲话内容,而是一张自拍照片。在论坛现场,一

  • 聚焦AI框架技术创新 加速大模型规模化落地

    “人工智能作为数字新基建重点建设方向,前景广阔,大有作为。今年的政府工作报告更首次提出开展‘人工智能+’行动,无疑将为人工智能技术在

  • 俄罗斯成功发射“联盟MS-25”载人飞船

    俄罗斯国家航天集团23日发布消息说,俄当天成功发射了“联盟MS-25”载人飞船。消息说,莫斯科时间23日15时36分(北京时间20时36分),“联盟MS-25”载人飞船

  • 中广核:用创新技术提升核电站“智”力

    在近日开幕的中国国际核工业展览会上,中国核学会理事会党委书记、理事长王寿君表示,中国内地现有在运核电机组55台、居全球第三;在建核电机组26台,保持

推荐资讯

  • 日榜
  • 周榜
  • 月榜