DeepSeek被稱為AI界拼多多,訓(xùn)練2個(gè)月僅花費(fèi)了557.6萬美元!
| 體育資訊1月28日報(bào)道宣稱 據(jù)錢江晚報(bào)報(bào)道,此次DeepSeek-V3在AI行業(yè)引發(fā)關(guān)注,關(guān)鍵的原因在于——超低的預(yù)訓(xùn)練成本。 “預(yù)訓(xùn)練”是AI大模型學(xué)習(xí)中的一種方法,指的是通過海量的數(shù)據(jù),訓(xùn)練一個(gè)大模型。訓(xùn)練時(shí)需要大量的數(shù)據(jù)和算力支持,每次迭代可能耗資數(shù)百萬至數(shù)億美元。
官方技術(shù)論文披露,DeepSeek-V3在預(yù)訓(xùn)練階段僅使用2048塊GPU訓(xùn)練了2個(gè)月,且只花費(fèi)557.6萬美元。這個(gè)費(fèi)用是什么概念? 據(jù)報(bào)道,GPT-4o的模型訓(xùn)練成本約為1億美元。簡單粗暴地說,這相當(dāng)于DeepSeek-V3比同等性能的AI大模型,降了十幾倍的成本。 早在2024年5月,深度求索發(fā)布DeepSeek-V2時(shí),就曾因給模型的定價(jià)太過于便宜,開啟了中國大模型的價(jià)格戰(zhàn),被稱之為“AI界的拼多多”。
“相比于說它是‘拼多多’,它更像小米,貼近成本定價(jià),并且自產(chǎn)自銷。”馬千里認(rèn)為,訓(xùn)練成本比較低的原因,離不開深度求索團(tuán)隊(duì)自研的架構(gòu)和算力,他們自身的算力儲備可以與大廠比肩,并且更注重底層的模型。 “ChatGPT走的是大參數(shù)、大算力、大投入的路子,DeepSeek-V3的路徑用了更多的巧思,依托數(shù)據(jù)與算法層面的優(yōu)化創(chuàng)新,從而高效利用算力,實(shí)現(xiàn)較好的模型效果?!瘪R千里說道。 |
相關(guān)閱讀
熱門標(biāo)簽
熱門新聞
NBA終極贏家,雷霆不僅要奪冠,他們獲得狀元簽概率已提升到10%!
遼寧男籃揭幕戰(zhàn)!全新陣容亮相,莫蘭德回歸首秀,央視直播
NBA最短巔峰只當(dāng)一年老大,就淪為流浪漢,29歲奔赴CBA
狂送4連?。÷?lián)盟現(xiàn)存最長連敗紀(jì)錄,NBA被高估的三巨頭,該散伙了
【W(wǎng)CBA聯(lián)賽】第一輪浙江稠州銀行71101不敵上海浦發(fā)銀行
公開指責(zé),德馬庫斯考辛斯指出快船隊(duì)災(zāi)難性開局真正罪魁禍?zhǔn)?/a>
這能打NBA曾凡博對韓國兩場拿2分,浪費(fèi)首發(fā)位置,被郭士強(qiáng)放棄
NBA周最佳公布:布倫森率隊(duì)4戰(zhàn)全勝,東契奇場均37.3+8.7+10.3
楊瀚森連續(xù)3場0分:4分半鐘3中0下半場被棄用NBA生涯三分14中1
消失的天才!從橫掃NCAA,到被NBA淘汰,他只用了5年時(shí)間

