成人免费xxxxx在线视频软件_久久精品久久久_亚洲国产精品久久久_天天色天天色_亚洲人成一区_欧美一级欧美三级在线观看

58行代碼把Llama 3擴展到100萬上下文,任何微調版都適用

人工智能 新聞
現在只需58行代碼,任何Llama 3 70b的微調版本都能自動擴展到1048k(一百萬)上下文。

堂堂開源之王Llama 3,原版上下文窗口居然只有……8k,讓到嘴邊的一句“真香”又咽回去了。

在32k起步,100k尋常的今天,這是故意要給開源社區留做貢獻的空間嗎?

開源社區當然不會放過這個機會:

現在只需58行代碼,任何Llama 3 70b的微調版本都能自動擴展到1048k(一百萬)上下文。

圖片

背后是一個LoRA,從擴展好上下文的Llama 3 70B Instruct微調版本中提取出來,文件只有800mb

接下來使用Mergekit,就可以與其他同架構模型一起運行或直接合并到模型中。

圖片

所使用的1048k上下文微調版本,剛剛在流行的大海撈針測試中達到全綠(100%準確率)的成績。

圖片

不得不說,開源的進步速度是指數級的。

圖片

1048k上下文LoRA怎么煉成的

首先1048k上下文版Llama 3微調模型來自Gradient AI,一個企業AI解決方案初創公司。

圖片

而對應的LoRA來自開發者Eric Hartford,通過比較微調模型與原版的差異,提取出參數的變化。

他先制作了524k上下文版,隨后又更新了1048k版本。

圖片

首先,Gradient團隊先在原版Llama 3 70B Instruct的基礎上繼續訓練,得到Llama-3-70B-Instruct-Gradient-1048k。

具體方法如下:

  • 調整位置編碼:用NTK-aware插值初始化RoPE theta的最佳調度,進行優化,防止擴展長度后丟失高頻信息
  • 漸進式訓練:使用UC伯克利Pieter Abbeel團隊提出的Blockwise RingAttention方法擴展模型的上下文長度

值得注意的是,團隊通過自定義網絡拓撲在Ring Attention之上分層并行化,更好地利用大型GPU集群來應對設備之間傳遞許多KV blocks帶來的網絡瓶頸。

最終使模型的訓練速度提高了33倍。

圖片

長文本檢索性能評估中,只在最難的版本中,當“針”藏在文本中間部分時容易出錯。

圖片

圖片

有了擴展好上下文的微調模型之后,使用開源工具Mergekit比較微調模型和基礎模型,提取參數的差異成為LoRA。

同樣使用Mergekit,就可以把提取好的LoRA合并到其他同架構模型中了。

合并代碼也由Eric Hartford開源在GitHub上,只有58行。

圖片

目前尚不清楚這種LoRA合并是否適用于在中文上微調的Llama 3。

不過可以看到,中文開發者社區已經關注到了這一進展。

圖片

524k版本LoRA:https://huggingface.co/cognitivecomputations/Llama-3-70B-Gradient-524k-adapter

1048k版本LoRA:https://huggingface.co/cognitivecomputations/Llama-3-70B-Gradient-1048k-adapter

合并代碼:https://gist.github.com/ehartford/731e3f7079db234fa1b79a01e09859ac

責任編輯:張燕妮 來源: 量子位
相關推薦

2023-06-30 09:49:23

模型Meta

2023-07-11 10:02:23

2023-08-29 18:23:46

代碼AI

2024-01-08 12:47:02

代碼模型Mistral

2023-06-28 18:10:27

羊駝家族大模型集體進化

2024-04-29 13:09:10

LLM架構性能

2025-05-15 09:16:00

2023-10-21 12:53:27

數據研究

2023-06-15 15:45:42

自然語言語言模型

2023-10-04 09:20:04

模型訓練

2024-03-14 08:11:45

模型RoPELlama

2017-05-11 14:00:02

Flask請求上下文應用上下文

2012-12-31 10:01:34

SELinuxSELinux安全

2022-09-14 13:13:51

JavaScript上下文

2025-05-09 07:50:30

2023-08-10 14:04:15

代碼模型

2022-09-15 08:01:14

繼承基礎設施基礎服務

2015-10-09 09:43:28

CSS CSS3

2024-11-11 08:00:00

2017-12-17 17:01:23

限界上下文系統模型
點贊
收藏

51CTO技術棧公眾號

主站蜘蛛池模板: 91在线区| 久久综合久色欧美综合狠狠 | 国产精品日韩欧美一区二区三区 | 91久久精品国产91久久性色tv | 超碰人人人人 | 一区二区福利视频 | 亚洲欧美精品 | 日本精品久久久一区二区三区 | 精品国产乱码久久久久久1区2区 | 成人在线观看网站 | 日韩在线欧美 | 精品国产乱码久久久久久88av | 亚洲一区二区视频 | 国产成人精品综合 | 中文字幕一区二区三区不卡 | 请别相信他免费喜剧电影在线观看 | 黄色a级一级片 | 亚洲人成网亚洲欧洲无码 | 成人欧美一区二区三区色青冈 | 午夜三级视频 | 99久久久99久久国产片鸭王 | 99精品在线观看 | 亚洲精选一区二区 | 亚洲成人一区二区 | 国产三级一区二区 | 欧美日韩高清一区 | 爱爱视频日本 | 午夜在线影院 | 日本一二三区在线观看 | 国产日韩一区二区 | 国产一区亚洲二区三区 | 国产精品亚洲成在人线 | 免费一级毛片 | 亚洲精品日韩综合观看成人91 | 欧美日韩免费视频 | 欧美中文在线 | 国产精品久久精品 | 久草青青草 | 亚洲伊人精品酒店 | 亚洲欧洲精品一区 | 毛片区|