• <menu id="w2i4a"></menu>
  • logo 慧都大數(shù)據(jù)(二)

    文檔首頁>>慧都大數(shù)據(jù)(二)>>擁抱開源 - 云上元數(shù)據(jù)管理

    擁抱開源 - 云上元數(shù)據(jù)管理


    上期我們講述的是實(shí)現(xiàn)數(shù)據(jù)工程師夢(mèng)想的一個(gè)小目標(biāo)《夢(mèng)想成真,只差一步》,里面提到了要實(shí)現(xiàn)數(shù)據(jù)超市的管理,數(shù)據(jù)工程師需要使用合適的工具將數(shù)據(jù)進(jìn)行整理、組合、分類后上架,然后業(yè)務(wù)分析師和數(shù)據(jù)科學(xué)家就可以使用了。

    hadoop

    在整個(gè)數(shù)據(jù)工程師的工作流程中,需要自始至終的進(jìn)行數(shù)據(jù)治理:我們需要將每種類型的數(shù)據(jù)進(jìn)行清晰的標(biāo)識(shí)以及分類,以利于其它角色的用戶進(jìn)行查找以及使用;我們需要將每種數(shù)據(jù)的使用范圍進(jìn)行管理以及監(jiān)控,以使得數(shù)據(jù)被合理、合法的使用;我們還要管理數(shù)據(jù)的生存周期以及質(zhì)量溯源,以利于數(shù)據(jù)質(zhì)量可以被監(jiān)管,無用數(shù)據(jù)被清除...... 因此本文中我們將著重介紹上圖中標(biāo)紅框的部分,介紹實(shí)現(xiàn)我們夢(mèng)想的工具Open Metadata Services - 開源組件Apache Atlas。

    這個(gè)模塊還在Apache的孵化中,最新的版本是8月16號(hào)發(fā)布的0.7版本。詳細(xì)文檔可以查看以下鏈接:http://atlas.incubator.apache.org/

    Atlas 最早由HortonWorks實(shí)現(xiàn),用來管理Hadoop項(xiàng)目里面的元數(shù)據(jù),進(jìn)而設(shè)計(jì)為數(shù)據(jù)治理的框架。后來開源出來給Apache社區(qū)進(jìn)行孵化,目前得到Aetna,Merck,Target,SAS等公司的支持進(jìn)行發(fā)展演進(jìn),IBM現(xiàn)在也積極貢獻(xiàn)功能,拿來為我所用。(其在HortonWorks公司的介紹材料鏈接: https://zh.hortonworks.com/apache/atlas/#section_1 ) 從其誕生歷史看,該框架天生就支持橫向海量擴(kuò)展,具備良好的集成能力,非常適合在云上使用。以下是其架構(gòu)圖:

    hadoop

    Apache網(wǎng)站介紹它的主要功能有:

    1、數(shù)據(jù)分類 ;

    2、集中審計(jì) ;

    3、搜索及溯源 ;

    4、安全及策略引擎 ;

    它的最核心部分Core就是類型管理系統(tǒng) Type System , 用戶可以把數(shù)據(jù)資產(chǎn)進(jìn)行類型定義,然后使用Ingest/Export 的模塊進(jìn)行元數(shù)據(jù)的導(dǎo)入、修改、刪除等管理。和外界的接口可以通過Rest API或使用Kafaka進(jìn)行消息交換。數(shù)據(jù)對(duì)象存放在按照?qǐng)D的模式進(jìn)行管理的Titan圖數(shù)據(jù)庫中,具體Titan又把元數(shù)據(jù)存放在HBase中,索引存放在Solr中。這樣用戶可以非常便捷和直觀的通過層次圖進(jìn)行瀏覽信息,可以按照文字進(jìn)行精確的查找。

    hadoop

    如上圖,我們將數(shù)據(jù)資產(chǎn)分成了五類,分別是:Pipeline、Data Set、Report、Model、Notebook,具體存儲(chǔ)的屬性是紅色框部分,描述了以上五種數(shù)據(jù)資產(chǎn)的詳細(xì)信息:例如它是哪類型業(yè)務(wù),數(shù)據(jù)質(zhì)量如何,歸在哪個(gè)項(xiàng)目里面,具體評(píng)級(jí)如何、用戶訪問權(quán)限如何等等......

    有了這個(gè)Open Data Services服務(wù)后,我們是否覺得又離夢(mèng)想近了一步?更詳細(xì)的使用我們將在未來文章分享。

    IBM對(duì)開源社區(qū)一直采取大力擁抱以及不遺余力地進(jìn)行支持的態(tài)度:

    hadoop

    IBM基于Cloud Foundry 打造了世界最大的PaaS平臺(tái)BlueMix,在上面部署了大量開源的云數(shù)據(jù)服務(wù)業(yè)務(wù) - 例如Cloudant源于CouchDB,DataWorks Forge構(gòu)建在Spark平臺(tái)之上?,F(xiàn)在我們將Atlas開源元數(shù)據(jù)管理部署到我們的云數(shù)據(jù)治理中,通過實(shí)際使用來促進(jìn)該項(xiàng)目的大力發(fā)展。我們有理由相信,未來IBM 將把開源的魔力繼續(xù)發(fā)揚(yáng)光大!

    更多大數(shù)據(jù)與分析相關(guān)行業(yè)資訊、解決方案、案例、教程等請(qǐng)點(diǎn)擊查看>>>

    詳情請(qǐng)咨詢在線客服!

    客服熱線:023-66090381

    掃碼咨詢


    添加微信 立即咨詢

    電話咨詢

    客服熱線
    023-68661681

    TOP
    三级成人熟女影院,欧美午夜成人精品视频,亚洲国产成人乱色在线观看,色中色成人论坛 (function(){ var bp = document.createElement('script'); var curProtocol = window.location.protocol.split(':')[0]; if (curProtocol === 'https') { bp.src = 'https://zz.bdstatic.com/linksubmit/push.js'; } else { bp.src = 'http://push.zhanzhang.baidu.com/push.js'; } var s = document.getElementsByTagName("script")[0]; s.parentNode.insertBefore(bp, s); })();