【世界新視野】MosaicML 推出 300 億參數(shù)模型,訓練成本 70 萬
時間:2023-06-25 00:13:39
【資料圖】
AI 創(chuàng)業(yè)公司 MosaicML 近日發(fā)布了其語言模型 MPT-30B,單從參數(shù)來看,這個模型具有 300 億參數(shù),放在如今動則上千億參數(shù)的模型領域中并沒有什么突出的地方。但這個新模型的訓練成本卻只有其他模型的零頭,有望擴大模型在更廣泛領域的運用。
MosaicML 的首席執(zhí)行官兼聯(lián)合創(chuàng)始人 Naveen Rao 表示,MPT-30B 的訓練成本為 70 萬美元,遠低于訓練 GPT-3 所需的數(shù)千萬美元。此外,MPT-30B 模型的質量超過了 OpenAI 在 2020 年發(fā)布的初版 GPT-3。由于 MPT-30B 的成本較低,體積較小,它也可以更快速地被訓練,并部署在本地硬件設備上。
MosaicML 使用了 Alibi 和 FlashAttention 技術來優(yōu)化模型,可以實現(xiàn)更長的文本長度和對 GPU 計算的高利用率。MosaicML 也是少數(shù)幾個能夠使用 Nvidia H100 GPU 的實驗室,相比以往,這使得每 GPU 的吞吐量增加了 2.4 倍以上,帶來更快的完成時間。
300 億參數(shù)這是一個在大模型領域經(jīng)常看到的數(shù)字,300 億參數(shù)為什么這么特殊呢?MosaicML 首席科學家 Frankle 則解釋道,首先 300 億參數(shù)能夠確保它可以在本地硬件上輕松運行,同時保持質量與 GPT-3 差不多或略優(yōu)于它。
其次任何超過 300 億參數(shù)限制的模型都需要將模型分解成多個平行段,通常也需要更加昂貴的多 GPU 設置。
除了讓 AI 技術更容易獲得之外,MosaicML 還專注于提高數(shù)據(jù)質量,以提高模型性能。他們目前正在開發(fā)工具,幫助用戶在預訓練過程中分層加入特定領域的數(shù)據(jù)。這確保了多樣化和高質量的數(shù)據(jù)組合。將模型擴展到 300 億參數(shù)只是 MosaicML 的第一步,接下來他們將以降低成本為前提,推出更大的、更高質量的模型。
開發(fā)者可以從 Hugging Face 下載并使用開源的 MPT-30B 基礎模型,開發(fā)者還可以在自己的硬件上用自己的數(shù)據(jù)對模型進行微調(diào)。
相關稿件
【世界新視野】MosaicML 推出 300 億參數(shù)模型,訓練成本 70 萬
焦點快報!黑龍江高考一本分數(shù)線出爐:文史430,理工408
瓦格納創(chuàng)始人被訴武裝叛亂,俄國民警衛(wèi)隊中央?yún)^(qū)軍官進入緊急狀態(tài)_環(huán)球速讀
端午出行熱度高 節(jié)前晚高峰每分鐘超10萬人同時打車|頭條
2023年婚后買房離婚后怎么分配?婚后買房屬于夫妻共同財產(chǎn)嗎? 環(huán)球快播報
男子回了個“OK”表情結果成被告 盡量使用文字形式進行表達! 環(huán)球快報
焦點播報:突發(fā)!國泰航空一客機突發(fā)故障,11人逃生途中受傷送醫(yī)!女乘客還原驚恐一幕:有人打電話給父母一直哭,有一個媽媽抱著孩子一直說對不起……
通訊!歐盟通過第11輪對俄制裁,俄外交部:制裁非法,已及時回應
FDIC意外“錯誤”披露,市場獲知硅谷銀行危機中獲救的巨頭名單 快播
最新消息:【文體市場面面觀】鄉(xiāng)村賽事要平衡好“商味”和“村味”_全球熱消息
天天最資訊丨【機會挖掘】國內(nèi)通用人形機器人將發(fā)布 產(chǎn)業(yè)鏈股或受關注
每日播報!僅4人踢遍五大聯(lián)賽:拉杜喬尤&鮑爾森&約維蒂奇&小克魯伊維特
信用債動能指數(shù)跟蹤:新券認購指數(shù)上漲(2023年6月第4周)|今日熱訊
信用利差周報:公用事業(yè)、地產(chǎn)利差小幅走闊 全球速遞
香港一客機中止起飛 11人受傷 8人穩(wěn)定3人已出院_環(huán)球簡訊
今晚七點!全國大學生數(shù)學建模競賽2022年知網(wǎng)研學獎獲獎團隊經(jīng)驗分享|全球熱推薦


