Apache Hadoop 分散儲存架構,橫向擴充與自動副本能力,單機扛不了的他來

隨著你的公司資料量暴增,開始遇到 NAS 或單機伺服器硬體容量都接近上限,當資料準備跨到 PB 等級時,升級單機硬體成本就很有得開會討論,而且討論考量磁陣列出狀況,修復過程也是一波災難,可考量服用「Apache Hadoop」核心元件 HDFS (Hadoop Distributed File System),能解決單機空間不夠跟應付老化損壞的經典分散式檔案儲存系統…

Apache Hadoop HDFS分散式儲存工具

Apache Hadoop 技術重點拆解

Apache Hadoop 你可以不依賴昂貴伺服器的情況下,來實現大量資料穩定存取。

區塊拆分與橫向擴充能力: Apache Hadoop 的分散式檔案系統(HDFS)將大檔案拆解成固定大小的 Block,分散儲存於叢集中的不同節點,遇到空間不足時,工程師不用停機拆換硬碟,只需向叢集加入在加入一台商用伺服器,系統便會自動將數據重平衡,主要解決單機硬體規格的上限問題。

有多副本容錯+自動修復機制: 有了分散式系統,遇到硬體壞軌或伺服器斷線被算是「日常狀況」,HDFS 預設 3 副本策略,將同一個 Block 備份在不同的實體 Server ,遇到異常況況,會立即將其他健康節點自動補齊缺失副本,實現「資料絕不遺失、日常營運零中斷」。

流式資料存取: 一般檔案系統偏重隨機讀寫,容易在磁碟尋址上耗費大量成本,Apache Hadoop 對海量資料採用「一次寫入,多次讀取」的設計,優化連續性的大區塊資料讀取。

老黑應用場景分析

用低成本建置企業級災難復原庫: 不用為了備份幾百 TB 的資料去購買動輒數百萬的高階 SAN 設備,利用工四汰換留下的二手伺服器組建先組個 Hadoop 叢集,先從軟體片下手,取得多副本容錯能力來抵禦硬體損壞風險,同時用低成本打造出一個備份基地。

AI 訓練數據源: 公司要推 BI 報表分析還是訓練自家的機器學習模型,都需要一個能穩定存取文字、影像、交易紀錄的數據湖,Apache Hadoop 高存取量,讓開發團隊在拉取大量數據時,不會因為 Disk I/O 而影響模型訓練效率。

這裡取得工具

官方網站與文件Apache Hadoop Official Page

專案原始碼與社群Apache Hadoop GitHub Repository

Add a Comment

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *

這個網站採用 Akismet 服務減少垃圾留言。進一步了解 Akismet 如何處理網站訪客的留言資料