Nvidia AI 產品的可能有的誤解和可能的解答|無涼小學堂
自從有電腦以來,軟體和硬體交替互為成長因果,至今仍然如此,更複雜的作業系統、應用軟體、圖形化影像化的資料,刺激更強更大的硬體,摩爾定律下,單位算力成本和單位儲存成本持續下降,又刺激更多的軟體新應用,早期有些開發者花很多精力節省硬體資源
(例如用組合語言assembly提高CPU運算速度節省DRAM、用輔助記憶體模擬主記憶體搬動資料等,又例如有些應用軟體嫌作業系統拖累,花功夫跳過作業系統直接處理底層東西)
因為硬體進步太快,競爭要素更快拋棄節省資源轉為更專注開發應用,軟體一個比一個龐大複雜
現在的軟體驅動力來到AI模型,一時間模型參數複雜龐大到硬體不堪負荷,有人努力縮小模型提高速度節省硬體資源,有人不管資源繼續用更大更强更貴的資源開發更好的應用,在摩爾定律還未死透的前提下,我相信後者才是對的,因為幾十年來就是如此~
收集彙總 Nvidia AI 產品的可能有的誤解和可能的解答
Q:Nvidia的A100/H100是GPU晶片chip
A:和VGA顯示卡Nvidia可賣晶片也可賣卡不同,A100/H100是以卡片的形式出貨,即使有些媒體或報告稱為GPU或chip,它還是卡,沒有單賣晶片,也不能單賣晶片,無論這張卡稱為卡或板或card或board或module,它就是需要SMT/PCBA的卡片(包含散熱)
個人認為比較好的說法是A100/H100加速卡,或A100/H100 GPU加速卡,至於上面用的GPU晶片,A100卡用GA100晶片,H100卡用GH100晶片
A:除了早期推廣所需,正常時期 Nvidia 大部分應該是賣 A100/H100 加速卡,給 Dell / HPE / Lenovo / Cisco / Supermicro / Gigabyte....十幾家 Server 品牌廠放在各自品牌 Server 上出貨,Nvidia 官網還有一個功能去篩選表列所有有搭配 A100 和 H100 的所有 Server 品牌客戶和型號,A100/H100,很多家都用,如果 Nvidia 的 A100/H100 卡主要都給自己品牌 Server 用,那這些客戶的 A100/H100 那裡來?
Q:DGX/HGX 這個名字代表 Nvidia 本身出的 Server
A:HGX 以上十幾家 Server 品牌廠都可以出經過 Nvidia 認證的自有品牌HGX Server,DGX Server 似乎只有 Nvidia 自己的 Server 產品
Q:AI Server 一定是高技術產品
A:AI Server 有很高技術也有很普通技術產品,看怎麼定義,如果以可以用 H100 就算 AI Server 的話,那只要選擇 PCIe 介面的 H100 加速卡,普通桌機和普通 Server 也可以用,所以問公司有沒有做 AI Server 或 H100 Server 沒有意義,HGX/DGX 規格 Server 要用 SXM 介面的 A100/H100 加速卡,也可用 NVLink 和 NVSwitch,加快 GPU 溝通速度並可連結成大型運算 clusters 叢集,技術高些
Q:H100 Server 比 A100 Server 技術更高
A:嚴格講沒有這種東西,廣義講,使用H100加速卡的或可稱為H100 server,使用 A100 加速卡的或可稱為 A100 Server,同樣,這也沒意義,H100 server system 不代表比 A100 server system 更高技術,差別是在 GPU 加速卡技術強很多,可能電源和散熱複雜些,和系統 system 運算力技術無關
Q:有用Nvidia H100/A100加速卡的廠商,都是Nvidia供應鏈?
A:不一定,大部分不是,例如 Nvidia 出貨 H100/A100 加速卡給 Dell / HPE / Supermicro / Lenovo ......,而這些人外包給 Server ODM,雖然機器內有 H100/A100,但是這部分 Server ODM 的客戶是 Dell / HPE / Lenovo ......,不是 Nvidia,否則因為 Nvidia GPU AI Server 市場佔有率高達60~70%,豈不每一家 Server 廠每十個 projects 都有6~7個屬於 Nvidia AI GPU,那不是全世界 Server Brands/ODM 都是 Nvidia 供應鏈? 只有 Nvidia 直接下單,直接出貨給 Nvidia 的 vendors 才算是 Nvidia 供應鏈,但 Nvidia AI GPU 創造更多需求,其他 Server ODM 也會透過 Dell / HP / Lenovo / 北美四大 ...... 等外包使用 Nvidia A100/H100 加速卡的 AI Server 訂單間接受惠
Q:為何需socket?
A:(1)選擇彈性,可以在最後組裝階段選擇不同的晶片,例如主機板的CPU需要socket,因為要讓final assembly組裝廠不需要SMT設備,就可在同一片主機板上,依據客戶訂單configuration,選擇不同的CPU型號,很容易的裝上去,甚至一般店面或DIY玩家,也可以自由選擇主機板和同型socket的不同CPU型號,人力組裝,所以主機板上需要彈性的CPU有socket,DRAM DIMM插槽、PCIe等slots都是一樣的意思、其他晶片例如chipset就不需要,因為其他所有晶片都是固定的,不需要選擇彈性
(2)Logistics,PC是用海運,昂貴CPU和DRAM可以空運,接省兩個月的營運資金成本積壓,也避免海運時價格波動,CPU定期降價及DRAM價格波動,2個月vs.2天,這個原因早年很重要,近年比較不重要
(3)升級機會,更換更新的CPU或更大容量的DRAM、SSD需要socket等連接器,這個原因也沒有早年重要了
Q:為何有些 PC 的 CPU 和 DRAM 不用 socket 插槽?
A:Socket 增加厚度,NB 等產品需要輕薄,CPU 直接 mount 在主機板降低厚度,有些 DRAM 也一樣打在主機板上
Q:VGA 顯示卡上的 GPU 需不需要 Socket?
A:以上1A需要Socket的(1)(2)(3)理由那一個在顯示卡上成立?一個也沒有,GPU佔絕大部分成本,卡和晶片綁一起製造、運輸、更換,為何需要Socket?所以GPU顯示卡向來不需要Socket
Q:Nvidia A100/H100 需不需要 Socket?
A:
(1)H100/A100是GPU加速卡,GPU顯示卡不用Socket,GPU加速卡也不用,理由一樣
(2)A100兩三年前就推出,H100推出也有一陣子了,Nvidia官網上一直有這兩張卡的圖片,上面沒有Socket不是早就公開了嗎?
Q:Nvidia HGX/DGX上面的CPU主機板上面有沒有Socket?
A:這個問題該問,因為確實可能有,目前的資料HGX/DGX主機板的CPU直接打在主機板,但不清楚HGX認證的其他品牌Server有沒有Socket
Q:以上影響多大?
A:根據TrendForce預估今年AI Server市場120萬台,Nvidia佔60~70%就不到100萬台,其中還有他牌HGX Server不確定,還有PCIe介面的A100/H100 Server主機板應該和一般Server一樣的Socket比例,這樣影響數就是幾十萬台,佔整體Socket市場或Server Socket市場比重多少?
Q:4張或8張A100/H100加速卡,用SXM bus連結到大板上面,有沒有Slot或connector等,這個是卡板和卡板的連結,一台8個,理論上是要有連接器connector的,這是誰的生意?
A:4張或8張A100/H100加速卡,用SXM bus連結到大板上面,有沒有Slot或connector等,這個是卡板和卡板的連結,一台8個,理論上是要有連接器connector的,這是誰的生意?而且這個要用到Nvidia NVLink技術,要快到讓每張GPU加速卡上的GPU可以共享其他卡上的80GB HBM DRAM,等於8個GA100/GH100 GPU共用640GB的HBM DRAM,connector/Slots規格和ASP應該不低

留言
張貼留言