久久久亚洲精品一区二区三区_精品无码午夜福利理论片_爱豆传媒在线观看视频_国产av综合第一页_精品国产乱码久久久久久鸭王1_广东少妇大战黑人34厘米视频_久久精品人人做人人综合_日韩国产成人无码av毛片_国产成人无码A区精油按摩_欧美一曲二曲三曲的区别小说

首頁 > 新車圖片 > 新車圖片 > 性能與成本雙贏:實測戴爾AI工作站支撐企業(yè)大模型的本地部署與訓(xùn)練

性能與成本雙贏:實測戴爾AI工作站支撐企業(yè)大模型的本地部署與訓(xùn)練

發(fā)布時間:2024-10-12 22:05:29
談到大模型私有化部署,很多人會首先想到數(shù)據(jù)中心,以為動輒就得使用很多臺服務(wù)來支撐。一些中小企業(yè)或者應(yīng)用部門,主要做知識庫和智能體方向的應(yīng)用,模型大小基本在70B以內(nèi)。只要搭配合理,用本地的專業(yè)工作站同樣可以訓(xùn)練推理,算得上極具性價比的方案了。
 
隨著OpenAI o1-preview的發(fā)布,大模型已經(jīng)越發(fā)成熟,距離走入企業(yè)生產(chǎn)應(yīng)用已經(jīng)很近了。但OpenAI提供訪問的次數(shù)非常有限,這給企業(yè)用戶的AI應(yīng)用普及帶來了一定的費用焦慮和困擾。為了應(yīng)對日益增長的訪問頻率需求,越來越多的企業(yè)用戶傾向于大模型的本地化部署。大模型本地部署可以極大地降低數(shù)據(jù)泄漏的風(fēng)險,而且系統(tǒng)響應(yīng)速度和實時性更強,在一些需要快速反饋的場景里優(yōu)勢非常明顯,同時也能應(yīng)對企業(yè)個性化需求。
 
通過在傳統(tǒng)數(shù)據(jù)中心上進行本地大模型部署的方法,會對IT設(shè)施帶來比較大的挑戰(zhàn),因為從計算資源來說,很多企業(yè)的數(shù)據(jù)中心計算資源很緊張,而且擴展成本比較高,甚至有些中小企業(yè)還不具備搭建數(shù)據(jù)中心的能力。所幸的是,對于知識庫等企業(yè)級AI 應(yīng)用來說,完全可以用高配的AI工作站來應(yīng)對計算需求,以經(jīng)濟高效的方式減輕對數(shù)據(jù)中心計算資源的壓力,從而降低云服務(wù)的成本支出。
 
這次我們選用的是Dell Precision 7960 Tower,搭載了4張「NVIDIA RTX 5880 Ada 」顯卡,每張顯卡顯存48GB,相當(dāng)于在1臺工作站里就能最多有192GB顯存,完全可以部署Llama3.1 70B模型。
 
 
Dell Precision 7960 Tower
 
70B模型擁有700億參數(shù)量,在語言理解和生成方面具有顯著優(yōu)勢,已經(jīng)能夠滿足常見的企業(yè)級AI應(yīng)用,比如知識庫應(yīng)用、對話問答等,同時多任務(wù)處理能力也很強,可以支持企業(yè)在一個統(tǒng)一的平臺上運行多種AI 應(yīng)用。同時,開源大模型70B的開放和靈活使得它在市場上具有廣泛的適用性,大大降低企業(yè)的使用成本。而且量化后的70B模型僅占70G的顯存,非常適合部署在工作站上,降低計算資源方面的成本。
 
購置機器前我們做了相對完整的測試和驗證,包括推理、訓(xùn)練和噪音測試,下面給大家分享一些數(shù)據(jù)。
 
一、測試環(huán)境
硬件配置:
硬件平臺:Dell Precision 7960 Tower
 
CPU: Intel(R) Xeon(R) w5-3433
 
內(nèi)存:64G DDR5 * 8
 
GPU: NVIDIA RTX 5880 ada * 4
 
軟件平臺環(huán)境:
操作系統(tǒng):ubuntu22.04
 
Driver Version: 550.107.02
 
CUDA: 12.1
 
軟件包:conda python3.10 torch2.4 vllm0.6.1
 
測試模型:
這次我們分別測試了單GPU、雙GPU以及四卡GPU的表現(xiàn)情況。并在不同的模型下進行測試,模型參數(shù)分別為8B/13B/32B/70B,具體模型名稱如下:
 
Meta-Llama-3.1-8B-Instruct
 
Baichuan2-13B-Chat
 
Qwen1.5-32B-Chat
 
Meta-Llama-3.1-70B-Instruct
 
說明:接下來的推理測試,會使用FP16或FP8格式進行測試。在模型名稱的后綴,如果有FP8字樣,則使用的是FP8格式,否則使用的是FP16格式。
 
FP8是NVIDIA、Arm、Intel聯(lián)合推出的8位浮點數(shù)據(jù)格式,用于加速深度學(xué)習(xí)訓(xùn)練和推理。相對于常用的半精度FP16而言,F(xiàn)P8在不損失多少精度的情況下,將顯存的占用大小減少了一半,特別適合于將大模型部署于工作站上。FP8訓(xùn)練利用E5M2/E4M3格式,具備與FP16相當(dāng)?shù)膭討B(tài)范圍,適用于反向傳播與前向傳播。FP8訓(xùn)練在相同加速平臺上的峰值性能顯著超越FP16/BF16,并且模型參數(shù)越大,訓(xùn)練加速效果越好,且其與16-bits訓(xùn)練在收斂性和下游任務(wù)表現(xiàn)上無顯著差異。
 
推理框架:
vllm推理引擎來進行測試,為最大程度利用GPU顯存,將其GPU utilization參數(shù)設(shè)置為0.99。
 
述語說明:
Batch size: 推理或訓(xùn)練時輸入的數(shù)據(jù)批量數(shù)量,為1表示單個輸入,例如一段文字,為2表明同時進行兩段文字的生成,以此類推。它代表的是用戶并發(fā)數(shù)量。
 
token/s:推理或訓(xùn)練的速度,每秒生成的數(shù)量。一個token是代表一個單詞或詞根,如果是中文的話,可能是一個字或一個詞。
 
AI 應(yīng)用場景測試列表

 

新車圖片更多>>

重大發(fā)現(xiàn):全球80%海域發(fā)現(xiàn)“吃塑料”細(xì)菌,已進化出降解能力 軟銀與OpenAI宣布成立合資公司,明年推出企業(yè)級AI解決方案 小鵬新一代人形機器人IRON亮相:首推女性形態(tài),目標(biāo)2026年規(guī)模量產(chǎn) 中國科學(xué)家破解140年難題:動輒百萬起抗癌藥成本有望斷崖下降! 三星美國泰勒工廠即將投入運營 ASML正協(xié)助安裝EUV設(shè)備 高德成小鵬Robotaxi首個全球生態(tài)伙伴,共推L4級自動駕駛出行服務(wù) 小鵬發(fā)布第二代VLA:大眾成首個客戶,將面向全球開源 東芝發(fā)布S300 AI系列監(jiān)控硬盤:針對AI負(fù)載進行優(yōu)化 上海第一輪汽車以舊換新補貼搖號報名10月25日啟動 Redmi K90 Pro Max發(fā)布:搭載5X潛望長焦鏡頭,3999元起 不到13kg重就有千匹馬力!奔馳新電機功率密度打破世界紀(jì)錄 Redmi K90標(biāo)準(zhǔn)版發(fā)布:搭載超級像素屏幕,起售價2599元 吉利銀河星耀8首個大版本OTA發(fā)布,新增哨兵模式 優(yōu)步推出Uber Electric計劃:美國網(wǎng)約車主換電動汽車可享最高5000美元補貼 快手進軍“AI編程”賽道,推出“工具+模型+平臺”產(chǎn)品矩陣 指導(dǎo)價9.78-12.78萬元 江鈴羿馳05S上市 9月熱門新SUV銷量:僅2款過萬,動不動就幾萬的訂單去哪了? 華為又出新車了?廣汽啟境首款車型明年亮相 預(yù)售價19.99 萬起!風(fēng)云T11截胡小米YU9 魏牌高山7: 標(biāo)配激光雷達(dá)+四驅(qū),不到29萬的家庭MPV新殺手來了! 以越級空間為馬悅意03長續(xù)航定義秋日出行 魏牌高山7震撼上市,28.58萬開啟家庭MPV價值新篇 純電奧迪A4曝光,700km續(xù)航挺好,但造型看不下去 全新奧迪A6L不老氣,大眾全新中型車有點料 奇瑞汽車提前“沖刺”第四季度加推4款SUV新車 iCAR V27領(lǐng)銜 政策紅利與長續(xù)航對決:榮威M7 DMH如何重塑10萬級混動市場格局? 購置稅退坡進入倒計時,新能源車市兜底戰(zhàn)打響! 極氪9X上市:搭2.0T超級電混發(fā)動機,純電巡航起步300公里 曝比亞迪今年海外銷量占比或?qū)⑼黄?0% 新時代B級車開創(chuàng)者 別克至境L7正式上市,限時權(quán)益價16.99萬~21.59萬元