這篇文章將為大家詳細(xì)講解有關(guān)Uber如何使用Apache Hudi近實(shí)時(shí)分析全球網(wǎng)絡(luò),文章內(nèi)容質(zhì)量較高,因此小編分享給大家做個(gè)參考,希望大家閱讀完這篇文章后對(duì)相關(guān)知識(shí)有一定的了解。
創(chuàng)新互聯(lián)服務(wù)項(xiàng)目包括孟津網(wǎng)站建設(shè)、孟津網(wǎng)站制作、孟津網(wǎng)頁(yè)制作以及孟津網(wǎng)絡(luò)營(yíng)銷策劃等。多年來,我們專注于互聯(lián)網(wǎng)行業(yè),利用自身積累的技術(shù)優(yōu)勢(shì)、行業(yè)經(jīng)驗(yàn)、深度合作伙伴關(guān)系等,向廣大中小型企業(yè)、政府機(jī)構(gòu)等提供互聯(lián)網(wǎng)行業(yè)的解決方案,孟津網(wǎng)站推廣取得了明顯的社會(huì)效益與經(jīng)濟(jì)效益。目前,我們服務(wù)的客戶以成都為中心已經(jīng)輻射到孟津省份的部分城市,未來相信會(huì)繼續(xù)擴(kuò)大服務(wù)區(qū)域并繼續(xù)獲得客戶的支持與信任!
Uber業(yè)務(wù)規(guī)??焖僭鲩L(zhǎng),覆蓋了60個(gè)國(guó)家的600個(gè)城市,累計(jì)10B的訂單。
并且?guī)缀醵际峭ㄟ^手機(jī)App來使用Uber,而100%都依賴于手機(jī)網(wǎng)絡(luò),需要近實(shí)時(shí)的監(jiān)控網(wǎng)絡(luò)的可靠性。
而無線網(wǎng)絡(luò)在各個(gè)地方的信號(hào)強(qiáng)弱均不一樣。
并且隨著時(shí)間的變化,信號(hào)強(qiáng)弱也發(fā)生變化;蜂窩網(wǎng)絡(luò)質(zhì)量、網(wǎng)絡(luò)格式的變化等等。
對(duì)于網(wǎng)絡(luò)性能的挑戰(zhàn)很多,如維度太多,數(shù)據(jù)量太大等。
一種不太高效的解決方案是使用批處理重新計(jì)算所有數(shù)據(jù),但開銷太高(重復(fù)讀取數(shù)據(jù))、對(duì)相同數(shù)據(jù)的重復(fù)計(jì)算、計(jì)算結(jié)果更新太慢。
使用增量處理,即只處理數(shù)據(jù)源的更新,增量更新結(jié)果,便可更快地計(jì)算出結(jié)果。
可使用Apache Hudi進(jìn)行增量拉取
對(duì)大數(shù)據(jù)引入了流式處理,只對(duì)變化的數(shù)據(jù)進(jìn)行增量處理,減少延遲,擴(kuò)展性更好。
基于Hudi的實(shí)現(xiàn)架構(gòu),Hudi會(huì)基于統(tǒng)計(jì)信息來管理文件,提供不同的視圖供不同的上層應(yīng)用使用,并且更通用。DB的變化會(huì)導(dǎo)入kafka,然后每隔數(shù)分鐘使用Hudi(DeltaStreamer)進(jìn)行消費(fèi),然后寫入Hudi數(shù)據(jù)集,在數(shù)據(jù)集上提供三種視圖(讀優(yōu)化視圖、實(shí)時(shí)視圖、增量視圖)供上層應(yīng)用使用。
Hudi在Uber中已經(jīng)構(gòu)建了超10PB的數(shù)據(jù)湖、1000個(gè)pipeline/表、每天處理100TB數(shù)據(jù)。
Hudi的增量模型使用微批任務(wù)(數(shù)分鐘),支持upsert(插入更新)結(jié)果集,支持增量拉取數(shù)據(jù)源變化的數(shù)據(jù)。
基于Hudi構(gòu)建的增量pipeline和展示面板
可使用Spark DataSource API 或者DeltaStreamer來讀取數(shù)據(jù)源/寫入Hudi數(shù)據(jù)集。
構(gòu)建增量pipeline,用來增量更新網(wǎng)絡(luò)指標(biāo)
Hudi增量拉取處理后,會(huì)合并之前處理的結(jié)果
增量更新指標(biāo)
總體的pipeline使用兩階段增量更新,第一階段結(jié)果在Sketch表(臨時(shí)表),第二階段合并為Summary表(最終結(jié)果總表),兩階段都涉及結(jié)果的合并。
Delta sketch和Delta summary均使用Hudi提供的DeltaStreamer實(shí)現(xiàn)。
Hudi在Uber的實(shí)踐經(jīng)驗(yàn)總結(jié),包括測(cè)試、運(yùn)維、監(jiān)控
生產(chǎn)環(huán)境的增量pipeline設(shè)置
pipeline的運(yùn)行時(shí)介紹,每天100GB,批量更新pipeline使用1200core、增量pipeline使用150core。
關(guān)于Uber如何使用Apache Hudi近實(shí)時(shí)分析全球網(wǎng)絡(luò)就分享到這里了,希望以上內(nèi)容可以對(duì)大家有一定的幫助,可以學(xué)到更多知識(shí)。如果覺得文章不錯(cuò),可以把它分享出去讓更多的人看到。