幫大家科普什麼是知識蒸餾

Mavs41Forever wrote:
nvda 還有一個moat 比較少人談 nvlink

..(恕刪)


+1
NVDA要販賣的是一個封閉系統
只是外人會專注GPU的發展

Blackwell系統用COWOS封裝整合HBM,系統各個元件只要有一個頻寬不足就會是bottleneck 

從Blackwell(兩個GPU die+HBM3)到Rubin (4個GPU die+HBM4),頻寬需求增加,純粹堆硬體是不足的,老黃的NVlink就預先想到~

老黃的黃氏定律要卷死別人,除了架構堆die外,頻寬的考量也是重點,開發速度比別人快,頻寬的擴展計劃也是重點,老黃早就想到了~

現在Mag7-1 都想要老黃吐出利潤
想用ASIC取代
問題是真正與AVGO合作開發
然後發現總體效能不如預期,時程拉長
不到黃河心不死
最後才會甘心好好的與老黃合作~

如果是長線投資則沒差⋯
Ok1988 wrote:
不少所謂的大V同一時間講同樣的話
這場景很熟
以前發生過好幾次
結果勒


你要不要拒用windows 和 Apple 啦

7大都開始用了說









Mavs41Forever
英翻"採用"有點誤導 他們就是用他們的設備run R1 讓人用。 你也可以下載model (not download APP) 在自己家裡run
Sinfield wrote:
近日,加州大學伯克利分校的研究人員開發出了中國開發的 AI 語言模型DeepSeek R1-Zero的小規模語言模型複製品,成本約30美元


https://github.com/Jiayi-Pan/TinyZero/tree/main

1/20 R1發表 1/23就有複製結果 還在趕paper 沒在過年的
H200 × 8GPU 算2.5hours
租金 $12/h * 2.5h ==> $30





===
takeaway
1. 算越久越好
2. 參數量越大越好
3. 參數量有門檻至少要1.5b 0.5b算再久也沒用
繼 微軟,Nvidia,AMD 站隊後,亞馬遜 AWS 也可接入 DeepSeek 了,再度有雲端大廠站隊…

-----------------
亞馬遜表示,DeepSeek-R1模型現在已可以在Amazon Web Services上使用,該公司首席執行官安迪·賈西告訴用戶「儘管用」。

----------------- 華爾街日報中文版 2025-02-01

看到閉源軟體 CloseAI 氣得跳腳就開心… 所有雲端廠商無意間撿到寶,馬上自己架設 DeepSeek 接入雲端。所有雲端使用者受惠…

Apple 更是偷笑到合不攏嘴,無端撿到一個全球可用的先進開源模型,只要自己架起來就好…

目前地表上只剩01理財版的綠毛,比各大雲端廠商法務還專業… 不斷跳針蒸餾蒸餾,事實上 CloseAI 自己的屁股也不乾淨…
Mavs41Forever wrote:
1/20 R1發表 1/23就有複製結果 還在趕paper 沒在過年的
[]
.(恕刪)


美國的研究生主力是博士班
不像台灣的研究生主力是碩士生

碩班生沒有功勞也有苦勞,畢業全憑老板一句話
博班生最怕的就是研究時發現prior art居然比你的研究還新
花了幾年的研究就完了,研究要轉彎
遇到這種大事
美國的農曆春節沒什麼氣氛
華人還不是除夕聚一下又沒有放假
Lab Rat還是要上工~

參數量夠大才有’湧現‘的現象發生⋯
假如說我寫了個app 丟到 google play 或 apple App Store

表示 Apple 認可我 用我的app在賺錢

站隊我這邊

這邏輯也說的通啦
只是那裏怪怪的
smallbeetw
那可不是一般消費性電子的 app store, 雲端AI如果有問題怎麼可能上架? 你不會是把 app 那個入口和 Nvidia 自己架設的 DeepSeek 搞混了吧?
Ok1988 wrote:
假如說我寫了...(恕刪)


股市可能不是20/80,而是10/90
看消息面容易追高殺低
當個容易割的韭菜~


投資不能看消息面

價值投資不看短期波動,我看年末的價格是多少,我又不缺錢,放著跟華爾街比氣長~
我的NVDA平均成本6X,我N年前就買了,去年初重倉,去年NVDA回檔三成家常便飯,這次怎麼還沒殺到10X?好期待~

華爾街操盤也要成本,低吸或下殺都要錢,不夠殺低,散戶想搭轎就繼續多空雙殺,籌碼乾淨了要炒,總要三成利潤才會回本⋯
Sinfield wrote:
股市可能不是20/80...(恕刪)


DS帶來的衝擊慢慢地大家開始懂得全貌
GPU不會因為DS的出現而不需要
相反的消息面的炒作
鄉民的看空
NVDA的股價殺低
其實我覺得殺得還不夠低...
價值投資可以等,跌一兩個月也不在乎...
川普的關稅的波動還會讓股價不確定性更久
等到華爾街的目的達到開始反向炒NVDA時
會不會有韭菜後悔當時太相信消息面呢???

就一個三兆市值的股票,要炒三成到4兆難度很高
但是狂跌三成割韭菜後再回升再賺一波
賺這三成就簡單的多...
去年年中以後華爾街就幹了兩次以上...
跟華爾街一起割韭菜,不香嗎...
股價跌到11X時會有支撐,很多YT都只是這樣說,其中有一個YT說出原因,除了散戶外,一些機構的機器人程式夠低就直接觸發買入,現在才2月,算績效的時間還久的,後面他們要操作還有足夠時間,因為目前牛市還未終結,年底的目標價應該還是漲的...

Mavs41Forever wrote:
是覺得我認為DS之後no labeled data 算力需求下降?
不 我認為算力需求是持續上升


看了一篇報導
覺得老黃真是老謀深算
DS的風潮
蒸餾後的所需算力的下降
這種用於精煉後的推理需求的硬體
老黃在GTC 2025推出了
Project Digits !!!
---------------------------------------
NV如何改變 AI 開發方式?

Nvidia Project Digits 的推出,大幅降低了進行大型 AI 模型開發的硬體門檻,提供與資料中心級別接近的效能:
模型開發與部署無縫銜接:
使用者可以在本地桌面開發、微調與測試模型,然後將模型部署至 Nvidia DGX Cloud 或資料中心,實現小型團隊到企業級規模的平滑過渡。
廣泛的軟體支援:
預載 Nvidia AI Enterprise 軟體平台,支援 PyTorch、Jupyter Notebook 等框架,還可透過 NeMo 框架 微調模型,為不同應用需求提供彈性。
數據處理與優化:
結合 Nvidia Rapids 加速資料科學處理,顯著縮短開發週期,提升效率。

Project Digits 如何造福 AI 開發者?
降低開發成本與門檻:
3000 美元起的價格,使更多小型團隊與學生可接觸到高效能 AI 開發工具。
單台設備即可完成原型設計與模型訓練,避免高昂的雲端運算成本。
創新與學術應用:
適合用於教育與研究環境,幫助學生與學者開發未來 AI 技術。
提供即時推理能力,助力原型快速測試與改進。
靈活擴展能力:
支援大型模型運算,對生成式 AI 應用(如自然語言處理與影像生成)尤為重要。
雙機聯動功能可滿足更高階需求,支援企業應用的快速擴展。
-------------------------------------------

LLM大模型的巨頭要買百萬張H100/Blackwell/ Rubin
推理用的老黃也沒有放過
這台才3000美金
DS的推出
一定會有更多客製化的AI推理硬體需求
然而AI算法的精進
純用Asic性能單一也不行

售價才3000美金都想買一台來玩...
全世界多少學術機構與研究部門/小公司有這需求
DS如果造成AI的普及化
那麼老黃早就算到了而且做出了因應
畢竟人家是AI硬體的老大
市場需求的嗅覺敏銳...

以後每個產業與相關公司要有自己的客製AI
那怕是從DS再蒸餾
多少還需要微調
這個市場就很大
Sinfield wrote:
看了一篇報導覺得老黃...(恕刪)


玩過local LLM 就會知道什麼是算力需求


$3000 GB10 128G



or 單卡
魔改 RTX 4090 48G

$4000 on ebay


很明顯的選擇
文章分享
評分
評分
複製連結
請輸入您要前往的頁數(1 ~ 10)

今日熱門文章 網友點擊推薦!