设置
  • 日夜间
    随系统
    浅色
    深色
  • 主题色

58行代码把Llama 3扩展到100万上下文,任何微调版都适用

2024-05-08 09:13:13 来源: 量子位

大模型进入组装时代Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

堂堂开源之王Llama 3,原版上下文窗口居然只有……8k,让到嘴边的一句“真香”又咽回去了。Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

在32k起步,100k寻常的今天,这是故意要给开源社区留做贡献的空间吗?Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

开源社区当然不会放过这个机会:Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

现在只需58行代码,任何Llama 3 70b的微调版本都能自动扩展到1048k(一百万)上下文。Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

背后是一个LoRA,从扩展好上下文的Llama 3 70B Instruct微调版本中提取出来,文件只有800mbMgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

接下来使用Mergekit,就可以与其他同架构模型一起运行或直接合并到模型中。Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

所使用的1048k上下文微调版本,刚刚在流行的大海捞针测试中达到全绿(100%准确率)的成绩。Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

不得不说,开源的进步速度是指数级的。Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

1048k上下文LoRA怎么炼成的

首先1048k上下文版Llama 3微调模型来自Gradient AI,一个企业AI解决方案初创公司。Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

而对应的LoRA来自开发者Eric Hartford,通过比较微调模型与原版的差异,提取出参数的变化。Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

他先制作了524k上下文版,随后又更新了1048k版本。Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

首先,Gradient团队先在原版Llama 3 70B Instruct的基础上继续训练,得到Llama-3-70B-Instruct-Gradient-1048k。Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

具体方法如下:Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

  • 调整位置编码:用NTK-aware插值初始化RoPE theta的最佳调度,进行优化,防止扩展长度后丢失高频信息
  • 渐进式训练:使用UC伯克利Pieter Abbeel团队提出的Blockwise RingAttention方法扩展模型的上下文长度

值得注意的是,团队通过自定义网络拓扑在Ring Attention之上分层并行化,更好地利用大型GPU集群来应对设备之间传递许多KV blocks带来的网络瓶颈。Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

最终使模型的训练速度提高了33倍。Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

长文本检索性能评估中,只在最难的版本中,当“针”藏在文本中间部分时容易出错。Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

有了扩展好上下文的微调模型之后,使用开源工具Mergekit比较微调模型和基础模型,提取参数的差异成为LoRA。Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

同样使用Mergekit,就可以把提取好的LoRA合并到其他同架构模型中了。Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

合并代码也由Eric Hartford开源在GitHub上,只有58行。Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

目前尚不清楚这种LoRA合并是否适用于在中文上微调的Llama 3。Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

不过可以看到,中文开发者社区已经关注到了这一进展。Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

524k版本LoRA:
https://huggingface.co/cognitivecomputations/Llama-3-70B-Gradient-524k-adapterMgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

1048k版本LoRA:
https://huggingface.co/cognitivecomputations/Llama-3-70B-Gradient-1048k-adapterMgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

合并代码:
https://gist.github.com/ehartford/731e3f7079db234fa1b79a01e09859acMgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

参考链接:
[1]https://twitter.com/erhartford/status/1786887884211138784Mgz流量资讯——探索最新科技、每天知道多一点LLSUM.COM

本文链接:58行代码把Llama 3扩展到100万上下文,任何微调版都适用http://www.llsum.com/show-2-5684-0.html

声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇: 上海期智研究院全球招人才!人工智能/信息安全/量子智能方向的来

下一篇: 《嬛嬛朕emo啦》但马斯克!阿里这项技术开放试玩

热门资讯

  • 明天氢能荣获国家电网科技进步奖一等奖

    记者3月18日从安徽明天氢能科技股份有限公司(以下简称明天氢能)获悉,国家电网近日向明天氢能及董事长王朝云分别授予科学技术进步奖一等奖,获奖项目为

  • 239万的无人驾驶航空器淘宝上架,人人可以“打飞的”还有多远

      239万的无人驾驶航空器淘宝上架,人人可以“打飞的”还有多远  239万元/架的无人驾驶载人航空器也看上了电商渠道。  3月18日,亿航智能设备(广州)有限公司(下称“亿航

  • Sora将如何影响科学与社会

    英国《自然》周刊网站3月12日刊登题为《OpenAI的文生视频工具Sora会如何改变科学——以及社会》的文章,作者为乔纳森·奥卡拉汉,内

  • 科学家用人工智能设计全新抗体

    据英国《自然》杂志网站19日报道,美国华盛顿大学科学家首次使用生成式人工智能(AI)工具,帮助他们制造全新抗体。研究团队表示,AI设计抗体或能更好靶向一

  • 借AI“慧眼”鉴别可疑论文图片

    今年1月,英国分子生物学家肖尔托·戴维发表文章,指控美国哈佛大学医学院附属丹娜-法伯癌症研究所科学家通过修改图片伪造数据。随后该研究所正

  • 国家工程师丨锻造能“听”清眼疾的高精设备

    眼眸深邃似海、璨如星河,中国医学科学院生物医学工程研究所眼科诊疗技术研发团队(以下简称“团队”)正是眼眸“侦探”。该团队不久前被授予“国家卓越

  • 联合国机构报告称2022年全球产生6200万吨电子垃圾

    联合国机构3月20日发布的《全球电子垃圾监测》报告显示,2022年全球范围内共产生6200万吨电子垃圾,其中仅有不到四分之一被回收利用。报告显示,2022年

  • 植物避盐性的关键基因被发现

    记者3月21日从安徽农业大学获悉,该校生命科学学院韩毅教授课题组与国内外专家合作,发现了植物避盐性的关键基因。该研究对于提高植物耐盐性,帮助盐碱

  • 银鲳高质量染色体水平 参考基因组发布

    3月19日,记者从中国科学院海洋研究所了解到,该所研究团队在国际上首次发布了银鲳的高质量染色体水平参考基因组。相关研究论文近日在线发表于《自然

  • 人工纳米流体突触可实现存内计算

    瑞士洛桑联邦理工学院工程学院研究团队制造了一种用于内存的新型纳米流体设备,这使他们第一次能连接两个“人工突触”。该设备为受大脑启发的液体硬

  • Kimi累趴下了,券商仍看好

    21世纪经济报道记者雷晨 北京报道近日,国内AI领域的明星产品——Kimi智能助手,因流量激增遭遇了短暂的服务中断。月之暗面随后发布公告,对此

  • 科技助力市场驱动 无人车产品赋能环卫物流等行业

    随着无人驾驶技术的快速发展,无人车在城市配送、环卫清扫、安防巡逻等应用场景中已得到较好示范应用。3月22日,南京溧水经济开发区管委会与南京易咖

推荐资讯

  • 日榜
  • 周榜
  • 月榜