溫馨提示×

溫馨提示×

您好，登錄后才能下訂單哦！

密碼登錄×

忘記密碼？

登錄注冊×

獲取短信驗證碼

其他方式登錄

點擊登錄注冊即表示同意《億速云用戶服務條款》

用戶登錄×

賬戶密碼登錄

請使用微信掃描上方二維碼

使用幫助

請求超時！

請點擊重新獲取二維碼

如何使用Spark進行實時流計算

發(fā)布時間：2020-08-04 11:58:21 來源：億速云閱讀：223 作者：小豬欄目：開發(fā)技術(shù)

這篇文章主要為大家展示了如何使用Spark進行實時流計算，內(nèi)容簡而易懂，希望大家可以學習一下，學習完之后肯定會有收獲的，下面讓小編帶大家一起來看看吧。

Spark Streaming VS Structured Streaming

Spark Streaming是Spark最初的流處理框架，使用了微批的形式來進行流處理。

提供了基于RDDs的Dstream API，每個時間間隔內(nèi)的數(shù)據(jù)為一個RDD，源源不斷對RDD進行處理來實現(xiàn)流計算

Apache Spark 在 2016 年的時候啟動了 Structured Streaming 項目，一個基于 Spark SQL 的全新流計算引擎 Structured Streaming，讓用戶像編寫批處理程序一樣簡單地編寫高性能的流處理程序。

Structured Streaming是Spark2.0版本提出的新的實時流框架（2.0和2.1是實驗版本，從Spark2.2開始為穩(wěn)定版本)

從Spark-2.X版本后，Spark Streaming就進入維護模式，看見Spark已經(jīng)將大部分精力投入到了全新的Structured Streaming中，而一些新特性也只有Structured Streaming才有，這樣Spark才有了與Flink一戰(zhàn)的能力。

1、Spark Streaming 不足

Processing Time 而不是 Event Time

首先解釋一下，Processing Time 是數(shù)據(jù)到達 Spark 被處理的時間，而 Event Time 是數(shù)據(jù)自帶的屬性，一般表示數(shù)據(jù)產(chǎn)生于數(shù)據(jù)源的時間。比如 IoT 中，傳感器在 12:00:00 產(chǎn)生一條數(shù)據(jù)，然后在 12:00:05 數(shù)據(jù)傳送到 Spark，那么 Event Time 就是 12:00:00，而 Processing Time 就是 12:00:05。我們知道 Spark Streaming 是基于 DStream 模型的 micro-batch 模式，簡單來說就是將一個微小時間段，比如說 1s，的流數(shù)據(jù)當前批數(shù)據(jù)來處理。如果我們要統(tǒng)計某個時間段的一些數(shù)據(jù)統(tǒng)計，毫無疑問應該使用 Event Time，但是因為 Spark Streaming 的數(shù)據(jù)切割是基于 Processing Time，這樣就導致使用 Event Time 特別的困難。

Complex, low-level api

這點比較好理解，DStream （Spark Streaming 的數(shù)據(jù)模型）提供的 API 類似 RDD 的 API 的，非常的 low level。當我們編寫 Spark Streaming 程序的時候，本質(zhì)上就是要去構(gòu)造 RDD 的 DAG 執(zhí)行圖，然后通過 Spark Engine 運行。這樣導致一個問題是，DAG 可能會因為開發(fā)者的水平參差不齊而導致執(zhí)行效率上的天壤之別。這樣導致開發(fā)者的體驗非常不好，也是任何一個基礎框架不想看到的（基礎框架的口號一般都是：你們專注于自己的業(yè)務邏輯就好，其他的交給我）。這也是很多基礎系統(tǒng)強調(diào) Declarative 的一個原因。

reason about end-to-end application

這里的 end-to-end 指的是直接 input 到 out，比如 Kafka 接入 Spark Streaming 然后再導出到 HDFS 中。DStream 只能保證自己的一致性語義是 exactly-once 的，而 input 接入 Spark Streaming 和 Spark Straming 輸出到外部存儲的語義往往需要用戶自己來保證。而這個語義保證寫起來也是非常有挑戰(zhàn)性，比如為了保證 output 的語義是 exactly-once 語義需要 output 的存儲系統(tǒng)具有冪等的特性，或者支持事務性寫入，這個對于開發(fā)者來說都不是一件容易的事情。

批流代碼不統(tǒng)一

盡管批流本是兩套系統(tǒng)，但是這兩套系統(tǒng)統(tǒng)一起來確實很有必要，我們有時候確實需要將我們的流處理邏輯運行到批數(shù)據(jù)上面。關(guān)于這一點，最早在 2014 年 Google 提出 Dataflow 計算服務的時候就批判了 streaming/batch 這種叫法，而是提出了 unbounded/bounded data 的說法。DStream 盡管是對 RDD 的封裝，但是我們要將 DStream 代碼完全轉(zhuǎn)換成 RDD 還是有一點工作量的，更何況現(xiàn)在 Spark 的批處理都用 DataSet/DataFrame API 了。

2.、Structured Streaming 優(yōu)勢

相對的，來看下Structured Streaming優(yōu)勢：

簡潔的模型。Structured Streaming 的模型很簡潔，易于理解。用戶可以直接把一個流想象成是無限增長的表格。
一致的 API。由于和 Spark SQL 共用大部分 API，對 Spaprk SQL 熟悉的用戶很容易上手，代碼也十分簡潔。同時批處理和流處理程序還可以共用代碼，不需要開發(fā)兩套不同的代碼，顯著提高了開發(fā)效率。
卓越的性能。Structured Streaming 在與 Spark SQL 共用 API 的同時，也直接使用了 Spark SQL 的 Catalyst 優(yōu)化器和 Tungsten，數(shù)據(jù)處理性能十分出色。此外，Structured Streaming 還可以直接從未來 Spark SQL 的各種性能優(yōu)化中受益。
多語言支持。Structured Streaming 直接支持目前 Spark SQL 支持的語言，包括 Scala，Java，Python，R 和 SQL。用戶可以選擇自己喜歡的語言進行開發(fā)。
同樣能支持多種數(shù)據(jù)源的輸入和輸出，Kafka、flume、Socket、Json。
基于Event-Time，相比于Spark Streaming的Processing-Time更精確，更符合業(yè)務場景。
Event time 事件時間: 就是數(shù)據(jù)真正發(fā)生的時間，比如用戶瀏覽了一個頁面可能會產(chǎn)生一條用戶的該時間點的瀏覽日志。
Process time 處理時間: 則是這條日志數(shù)據(jù)真正到達計算框架中被處理的時間點，簡單的說，就是你的Spark程序是什么時候讀到這條日志的。
事件時間是嵌入在數(shù)據(jù)本身中的時間。對于許多應用程序，用戶可能希望在此事件時間操作。例如，如果要獲取IoT設備每分鐘生成的事件數(shù)，則可能需要使用生成數(shù)據(jù)的時間（即數(shù)據(jù)中的事件時間），而不是Spark接收他們的時間。事件時間在此模型中非常自然地表示 - 來自設備的每個事件都是表中的一行，事件時間是該行中的一個列值。
支持spark2的dataframe處理。
解決了Spark Streaming存在的代碼升級，DAG圖變化引起的任務失敗，無法斷點續(xù)傳的問題。
基于SparkSQL構(gòu)建的可擴展和容錯的流式數(shù)據(jù)處理引擎，使得實時流式數(shù)據(jù)計算可以和離線計算采用相同的處理方式（DataFrame&SQL）。
可以使用與靜態(tài)數(shù)據(jù)批處理計算相同的方式來表達流計算。

底層原理完全不同

Spark Streaming采用微批的處理方法。每一個批處理間隔的為一個批，也就是一個RDD，我們對RDD進行操作就可以源源不斷的接收、處理數(shù)據(jù)。

如何使用Spark進行實時流計算

Structured Streaming將實時數(shù)據(jù)當做被連續(xù)追加的表。流上的每一條數(shù)據(jù)都類似于將一行新數(shù)據(jù)添加到表中。

如何使用Spark進行實時流計算

Spark 3.0.0發(fā)布以后全新的Structured Streaming UI誕生，可見未來的Structured Streaming將不斷迎來進步。

以上就是關(guān)于如何使用Spark進行實時流計算的內(nèi)容，如果你們有學習到知識或者技能，可以把它分享出去讓更多的人看到。

向AI問一下細節(jié)

推薦閱讀：

免責聲明：本站發(fā)布的內(nèi)容（圖片、視頻和文字）以原創(chuàng)、轉(zhuǎn)載和分享為主，文章觀點不代表本網(wǎng)站立場，如果涉及侵權(quán)請聯(lián)系站長郵箱：is@yisu.com進行舉報，并提供相關(guān)證據(jù)，一經(jīng)查實，將立刻刪除涉嫌侵權(quán)內(nèi)容。

上一篇新聞：
云計算時代中小企業(yè)服務器選型雜談
下一篇新聞：
ThinkPHP實現(xiàn)分頁實例

猜你喜歡

AI
助
手

產(chǎn)品服務

地區(qū)劃分

專題活動

幫助支持

關(guān)于我們

售后咨詢

7*24小時在線電話：400-100-2938

7*24小時在線 QQ：800811969

關(guān)注億速云

億速云公眾號

手機網(wǎng)站二維碼