傳統磁碟陣列(RAID)的衰落與新一代檔案系統 ZFS 之興起


vgbjack wrote:
缺點:
擴容要一顆一顆換,或組同樣的陣列來並行擴充,<-這點還沒實際用過,我也不太清楚,有請大神講解


zpool 一旦建立後, 資料開始寫入後, 最好不要再添加新的 udev 去擴充 zpool 容量, 雖然 zfs 是允許後續增加 udev, 但是新的 udev 加入後, 舊資料是不會自動移轉過去的, 這樣子的情況就好比 你有兩個水桶, 一個半滿, 一個是全空的, 它無法把半滿的水倒到空的水桶內. 然後如果 zpool 其中一個 udev 容量滿了, 那麼整個 zpool 效能就會跌下來, 而且是跌到原來的 20% 以下或是更慘. btrfs 有所謂的 Balance 功能, 但是 zfs 沒有.

其實我知道很多很多 zfs 的缺點. 譬如, 如果你在 zfs 所建立的 virtual block device 下面給 vm guest 使用, 那麼 vm guest 絕對不可以使用 lvm! 不然又是 raid on raid 找死!

zpool 的也是有生命週期的, 它剛建立好的時候, 效能是 100%, 但是使用3年後, 它的效能就會降到之前的 60%~70%. 感覺是 ssd trim 的問題. 大部分這個時候 storage admin 都會把 data 移轉到備援的 storage server 上 (當然是 zfs pool) 把整個 zpool destroy 掉, 所有的 hd 都使用 hard format 寫入 0 到每一個 block 裏面後, 重新建立 pool, 再把資料倒回來. 它的效能又會恢復到 100% 這個問題連 oracle 原廠的伺服器都有類似的情況. 這個也是爲什麼2016年我要更新我的 san.... 我的這個 pool 已經用了 3年了, 上面的 ssd 也該淘汰換新, 順便重建我的 pool.

raidz2 效能很差, 輸 raiz1, 這個跟 raid6 的效能輸給 raid5 一樣. (當 hd 數都只有 8顆時)

zfs 需要多顆 HD.... 越多顆速度越快. 所以 zfs 最好是 3u 或是 4u 或是更大臺的巨無霸. 它其實並不適合 4 bay 的 nas. 而且它需要 ssd 加速, 那樣子它的效能才會出來.

zfs 的未來因爲 oracle 的關係, 非常暗淡, zfs 有一個很糟糕的後母 oracle. 同時因爲 oracle 的關係, zfs 永遠不會得到任何其它大廠的贊助或是資源, 如 intel, cisco,hp, ibm, sandisk 它們都有支援很多開源軟體項目. 不像是 pfsense 是有 cisco 跟 intel 贊助的.

目前 btrfs 大家是很期待, 但是它不支援 virtual block device. 它沒有類似 zfs send & zfs recv 的指令 (用來作異機備份) 而且它最重要的, 它無法使用 ssd 來當 cache 加速. 但是 btrfs 是 google 推薦的檔案格式, 而 zfs 是被 google 唾棄的.
hoover91125 wrote:
感謝樓主分享資訊看...(恕刪)
Oneplus 8 Pro• Thinkpad T480s• PVE6+OMV4+NextCloud
最新的硬體的 zfs + ib 的效能測試 這裏

如果 zfs + ib + rdma (srp + srpt) 的話, 讀寫超過 2000mb/s 是很輕鬆的事.

zfis + ib + iscsi 的話, 效能只有 1/4 500多 mb/s...

所以 zfs 要發揮它完全的效能, 還是要看你搭配怎麼樣的連接方式....
Oneplus 8 Pro• Thinkpad T480s• PVE6+OMV4+NextCloud

EluSiOn wrote:
zpool 一旦建...(恕刪)



用3年後效能下降,難道是ZPOOL容量快滿了?還是因為你l2arc的SSD壽命問題?
現實中也是很多SSD用久後要重新格式化才能回復一定效能的狀況

以上猜測
個人之前也用過2*128G SSD做RAID0,效果好像沒加記憶體來的有用!?後來就沒用了
現在只用2*24G SLC SSD做RAID1當ZIL
我是兩個 240g ssd 做 raid 0當 cache 兩個 24g slc ssd 做 raid 1 當 zil. 看來應該還是 ssd sata trim 的問題造成效能下降。 不過新版的 zfs pool 已經不怕 zil 損壞然後整個 pool 的資料不見了,所以未來只要 NVMe ssd 各一顆做 cache 跟 zil. 我的 ssd cache 有 45% hit rates 所以是有使用到的。

vgbjack wrote:
用3年後效能下降,難...(恕刪)
"新版的 zfs pool 已經不怕 zil 損壞" <-指的是28版本嗎
freebsd9 或freenas9以上應該都是原生支持28版本
但沒試過拔掉zil碟來測試

你用的網站的版本是多少?看不太懂
原生支持的系統就是省事...


EluSiOn wrote:
我是兩個 240g...(恕刪)
vgbjack wrote:
"新版的 zfs p...(恕刪)


從第25版的 zfs 就沒有那麼依賴 zil 了
vgbjack wrote:
用3年後效能下降,難道是ZPOOL容量快滿了?還是因為你l2arc的SSD壽命問題?
現實中也是很多SSD用久後要重新格式化才能回復一定效能的狀況
以上猜測
個人之前也用過2*128G SSD做RAID0,效果好像沒加記憶體來的有用!?後來就沒用了
現在只用2*24G SLC SSD做RAID1當ZIL


L2ARC的效能不如直接cache在DRAM上,不過這跟伺服器的工作性質有和chache algorism有關,所以Hybrid的架構做cache兼deduplication現在正夯。一般 SATA SSD的效能仍有瓶頸,速度比SAS 3.0 HDD burst速度更慢,如改用 FusionIO或其他PCIe/NVme等規格SSD才會有相當差異。尤其是Write Cache效能。
PCIe gen3 x8規格SSD,理論速度可以到64Gbps(8.5GBps DATA),單顆Samsung NVMe SSD實際速度也可以到2GBps左右,沒有SATA SSD的限制。
面對巨量資料與雲端虛擬化趨勢,企業不僅得應付龐大的資料量,還需要提升資訊基礎架構的靈活彈性與使用效率。為了協助企業更有效運用儲存資源、提高IT投資效益,儲存硬體也逐漸走出專屬封閉規格,近年來,軟體定義儲存(Software Defined Storage,SDS)更是廣泛的受到討論,並且在新世代儲存架構中扮演重要角色。

所以 ZFS 是 SDS 的一種, 自然而然傳統磁碟陣列(RAID)一定會衰落, 而 zfs 是軟體管理直達設備底層 通用型硬體擺脫限制. 但是目前各家對於 SDS 定義不同, 如果由 swiftstack 來說, 他們定義又跟 nexenta 不同.

但是有一點可以確定地的, 抱著傳統硬體RAID就是王道的族群, 市場會越來越縮小, 然後會慢慢的被淘汰但不會消失, , 做 IT 的, 如果不懂得淘汰自己舊的技術, 那麼就是等著產業來淘汰你.
Oneplus 8 Pro• Thinkpad T480s• PVE6+OMV4+NextCloud

BigMac4Diet wrote:
L2ARC的效能不...(恕刪)


SSD 最大的功能本來就是透過 pcie/NVMe 來讀寫最好, SATA/SAS controller 本來就是 SSD 的瓶頸, 所以我們前幾年使用的 SATA SSD 基本上都是被閹割的 SSD 效能在跑. 現在 NVMe 的 SSD 效能都是 sata SSD 效能的 4~5 倍.
Oneplus 8 Pro• Thinkpad T480s• PVE6+OMV4+NextCloud
EluSiOn wrote:
SSD 最大的功能本來就是透過 pcie/NVMe 來讀寫最好, SATA/SAS controller 本來就是 SSD 的瓶頸, 所以我們前幾年使用的 SATA SSD 基本上都是被閹割的 SSD 效能在跑. 現在 NVMe 的 SSD 效能都是 sata SSD 效能的 4~5 倍.


SATA SSD並不是被閹割的SSD,架構甚至控制器核心和NVMe版並沒太大差異,它的問題主要來是來自於SATA傳輸協定的限制。
ATA指令的效率不佳,以及SATA頻寬上限低於SSD技術能力,雖然單通道速度高達6Gbps,但是只指令只能跑在一個雙向單通道上,這樣就形成了無解的瓶頸,不管怎樣最佳化,讀寫就是500MB左右,不過IOPS能夠顯著超越舊設計,在伺服器上仍能占有優勢。
NVMe的速度可以拉上去,是因為用了更大的DRAM做cache。如果把NVMe driver的chache強迫關閉,效能其實跟SATA SSD差不多(快一點而已)。而NVMe SSD 比 PCIe AHCI SSD效能好,則是因為Driver效率較佳。
明年NVMe SSD的能見度應該會起來。
文章分享
評分
評分
複製連結
請輸入您要前往的頁數(1 ~ 9)

今日熱門文章 網友點擊推薦!