Spark1.6升級2.x防踩坑指南

Spark 2.x自2.0.0發(fā)布到目前的2.2.0已經(jīng)有一年多的時間了，2.x宣稱有諸多的性能改進，相信不少使用Spark的同學還停留在1.6.x或者更低的版本上，沒有升級到2.x或許是由于1.6相對而言很穩(wěn)定，或許是升級后處處踩坑被迫放棄。

“專業(yè)、務(wù)實、高效、創(chuàng)新、把客戶的事當成自己的事”是我們每一個人一直以來堅持追求的企業(yè)文化。創(chuàng)新互聯(lián)是您可以信賴的網(wǎng)站建設(shè)服務(wù)商、專業(yè)的互聯(lián)網(wǎng)服務(wù)提供商! 專注于網(wǎng)站制作、成都網(wǎng)站制作、軟件開發(fā)、設(shè)計服務(wù)業(yè)務(wù)。我們始終堅持以客戶需求為導(dǎo)向，結(jié)合用戶體驗與視覺傳達，提供有針對性的項目解決方案，提供專業(yè)性的建議，創(chuàng)新互聯(lián)建站將不斷地超越自我，追逐市場，引領(lǐng)市場！

Spark SQL是Spark中最重要的模塊之一，基本上Spark每個版本發(fā)布SQL模塊都有不少的改動，而且官網(wǎng)還會附帶一個Migration Guide幫忙大家升級。問題在于Migration Guide并沒有詳盡的列出所有變動，本文以SQL模塊為主，扒一扒Spark升級2.x過程中可能會踩到的坑。

[[207387]]

計算準確性

那些升級后，讓你感到心中有千萬只草泥馬奔騰而過的問題

SELECT '0.1' = 0返回的是true!Spark 2.2中，0.1會被轉(zhuǎn)換為int，如果你的數(shù)據(jù)類型全部是文本類型，做數(shù)值計算時，結(jié)果極有可能不正確。之前的版本中0.1會被轉(zhuǎn)換為double類型絕大多數(shù)場景下這樣的處理是正確的。目前為止，社區(qū)還沒有很好的處理這個問題，針對這個問題，我給社區(qū)提交過一個PR，想要自己解決這個問題的同學，可以手動合并下：https://github.com/apache/spark/pull/18986
過于復(fù)雜的SQL語句執(zhí)行可能會出現(xiàn)64KB字節(jié)碼編譯限制的問題，這算是個老問題了，Spark自從上了Tungsten基本上一直存在這個問題，也算是受到了JVM的限制，遇到此類問題，建議大家找找PR：https://github.com/apache/spark/search?utf8=%E2%9C%93&q=64KB&type=Issues
數(shù)據(jù)計算精度有問題，SELECT 1 > 0.0001會報錯，這個問題已在2.1.2及2.2.0中修復(fù)：https://issues.apache.org/jira/browse/SPARK-20211
2.1.0版本中INNER JOIN涉及到常量計算結(jié)果不正確，后續(xù)版本已修復(fù)：https://issues.apache.org/jira/browse/SPARK-19766
2.1.0中，執(zhí)行GROUPING SET(col)，如果col列數(shù)據(jù)為null，會報空指針異常，后續(xù)版本已修復(fù)：https://issues.apache.org/jira/browse/SPARK-19509
2.1.0中，嵌套的CASE WHEN語句執(zhí)行有可能出錯，后續(xù)版本已修復(fù)：https://issues.apache.org/jira/browse/SPARK-19472

行為變化

那些不算太致命，改改代碼或配置就可以兼容的問題。

Spark 2.2的UDAF實現(xiàn)有所變動，如果你的Hive UDAF沒有嚴格按照標準實現(xiàn)，有可能會計算報錯或數(shù)據(jù)不正確，建議將邏輯遷移到Spark AF，同時也能獲得更好的性能
Spark 2.1開始全表讀取分區(qū)表采用FilePartition的方式，單個Partition內(nèi)可以讀取多個文件，如果對文件做了壓縮，這種方式有可能導(dǎo)致查詢性能變差，可以適當降低spark.sql.files.maxPartitionBytes的值，默認是128MB(對于大部分的Parquet壓縮表來說，這個默認設(shè)置其實會導(dǎo)致性能問題)
Spark 2.x限制了Hive表中spark.sql.*相關(guān)屬性的操作，明明存在的屬性，使用SHOW TBLPROPERTIES tb("spark.sql.sources.schema.numParts")無法獲取到，同理也無法執(zhí)行ALTER TABLE tb SET TBLPROPERTIES ('spark.sql.test' = 'test')進行修改
無法修改外部表的屬性ALTER TABLE tb SET TBLPROPERTIES ('test' = 'test')這里假設(shè)tb是EXTERNAL類型的表
DROP VIEW IF EXISTS tb，如果這里的tb是個TABLE而非VIEW，執(zhí)行會報錯AnalysisException: Cannot drop a table with DROP VIEW，在2.x以下不會報錯，由于我們指定了IF EXISTS關(guān)鍵字，這里的報錯顯然不合理，需要做異常處理。
如果你訪問的表不存在，異常信息在Spark2.x里由之前的Table not found變成了Table or view not found，如果你的代碼里依賴這個異常信息，就需要注意調(diào)整了。
EXPLAIN語句的返回格式變掉了，在1.6里是多行文本，2.x中是一行，而且內(nèi)容格式也有稍微的變化，相比Spark1.6，少了Tungsten關(guān)鍵字;EXPLAIN中顯示的HDFS路徑過長的話，在Spark 2.x中會被省略為...

2.x中默認不支持笛卡爾積操作，需要通過參數(shù)spark.sql.crossJoin.enabled開啟

OLAP分析中常用的GROUPING__ID函數(shù)在2.x變成了GROUPING_ID()

如果你有一個基于Hive的UDF名為abc，有3個參數(shù)，然后又基于Spark的UDF實現(xiàn)了一個2個參數(shù)的abc，在2.x中，2個參數(shù)的abc會覆蓋掉Hive中3個參數(shù)的abc函數(shù)，1.6則不會有這個問題

執(zhí)行類似SELECT 1 FROM tb GROUP BY 1的語句會報錯，需要單獨設(shè)置spark.sql.groupByOrdinal false類似的參數(shù)還有spark.sql.orderByOrdinal false

CREATE DATABASE默認路徑發(fā)生了變化，不在從hive-site.xml讀取hive.metastore.warehouse.dir，需要通過Spark的spark.sql.warehouse.dir配置指定數(shù)據(jù)庫的默認存儲路徑。

CAST一個不存在的日期返回null，如：year('2015-03-40')，在1.6中返回2015

Spark 2.x不允許在VIEW中使用臨時函數(shù)(temp function)https://issues.apache.org/jira/browse/SPARK-18209
Spark 2.1以后，窗口函數(shù)ROW_NUMBER()必須要在OVER內(nèi)添加ORDER BY，以前的ROW_NUMBER() OVER()執(zhí)行會報錯
Spark 2.1以后，SIZE(null)返回-1，之前的版本返回null

Parquet文件的默認壓縮算法由gzip變成了snappy，據(jù)官方說法是snappy有更好的查詢性能，大家需要自己驗證性能的變化

DESC FORMATTED tb返回的內(nèi)容有所變化，1.6的格式和Hive比較貼近，2.x中分兩列顯示

異常信息的變化，未定義的函數(shù)，Spark 2.x: org.apache.spark.sql.AnalysisException: Undefined function: 'xxx’., Spark 1.6: AnalysisException: undefined function xxx，參數(shù)格式錯誤：Spark 2.x:Invalid number of arguments, Spark 1.6: No handler for Hive udf class org.apache.hadoop.hive.ql.udf.generic.GenericUDAFXXX because: Exactly one argument is expected..

Spark Standalone的WebUI中已經(jīng)沒有這個API了：/api/v1/applications：https://issues.apache.org/jira/browse/SPARK-12299，https://issues.apache.org/jira/browse/SPARK-18683

版本回退

那些升級到2.x后，發(fā)現(xiàn)有問題回退后，讓你欲哭無淚的問題。

Spark 2.0開始，SQL創(chuàng)建的分區(qū)表兼容Hive了，Spark會將分區(qū)信息保存到HiveMetastore中，也就是我們可以通過SHOW PARTITIONS查詢分區(qū)，Hive也能正常查詢這些分區(qū)表了。如果將Spark切換到低版本，在更新分區(qū)表，HiveMetastore中的分區(qū)信息并不會更新，需要執(zhí)行MSCK REPAIR TABLE進行修復(fù)，否則再次升級會出現(xiàn)缺數(shù)據(jù)的現(xiàn)象。

Spark 2.0 ~ 2.1創(chuàng)建的VIEW并不會把創(chuàng)建VIEW的原始SQL更新到HiveMetastore，而是解析后的SQL，如果這個SQL包含復(fù)雜的子查詢，那么切換到1.6后，就有可能無法使用這個VIEW表了(1.6對SQL的支持不如2.x)

其他

從2.2.0開始，Spark不在支持Hadoop 2.5及更早的版本，同時也不支持Java 7 了，所以，如果你用的版本比較老，還是盡快升級的比較好。

2.x中對于ThriftServer或JobServer這樣的長時間運行的服務(wù)，穩(wěn)定性不如1.6，如果您的計算業(yè)務(wù)復(fù)雜、SQL計算任務(wù)繁多、頻繁的更新數(shù)據(jù)、處理數(shù)據(jù)量較大，穩(wěn)定性的問題更加凸顯。穩(wěn)定性問題主要集中在內(nèi)存方面，Executor經(jīng)常出現(xiàn)堆外內(nèi)存嚴重超出、OOM導(dǎo)致進程異常退出等問題。Executor進程OOM異常退出后相關(guān)的block-mgr目錄(也就是SPARK_LOCAL_DIRS)并不會被清理，這就導(dǎo)致Spark Application長時間運行很容易出現(xiàn)磁盤被寫滿的情況。

總結(jié)

Spark 2.x中為了性能，SQL模塊的改動相當大，這也導(dǎo)致Bug變多，穩(wěn)定性變差。當然，隨著Spark的不斷改進迭代，這些問題也在逐步緩解。

對于一個計算服務(wù)，相比性能，數(shù)據(jù)計算的正確性及穩(wěn)定性更加重要。建議尚未升級到2.x的同學，最好使用最新的Spark版本做升級;升級前，務(wù)必結(jié)合自己的業(yè)務(wù)場景做好充分的測試，避免踩坑。

文章標題：Spark1.6升級2.x防踩坑指南
標題路徑：http://uogjgqi.cn/article/dhgooij.html

掃二維碼與項目經(jīng)理溝通

我們在微信上24小時期待你的聲音

解答本文疑問/技術(shù)咨詢/運營咨詢/技術(shù)建議/互聯(lián)網(wǎng)交流

av激情亚洲男人的天堂国语,日韩欧美精品一中文字幕,无码av一区二区三区无码,国产又色又爽又刺激的a片,国产又色又爽又刺激的a片

Spark1.6升級2.x防踩坑指南

掃二維碼與項目經(jīng)理溝通

其他資訊

行業(yè)動態(tài)

企業(yè)網(wǎng)站建設(shè)的重要性！

服務(wù)項目

網(wǎng)站建設(shè)

移動端/APP

微信/小程序

技術(shù)支持

其它服務(wù)

更多服務(wù)項目

聯(lián)系吧在百度地圖上找到我們

電話：13518219792

av激情亚洲男人的天堂国语,日韩欧美精品一中文字幕,无码av一区二区三区无码,国产又色又爽又刺激的a片,国产又色又爽又刺激的a片

Spark1.6升級2.x防踩坑指南

掃二維碼與項目經(jīng)理溝通

其他資訊

行業(yè)動態(tài)

企業(yè)網(wǎng)站建設(shè)的重要性！

服務(wù)項目

網(wǎng)站建設(shè)

移動端/APP

微信/小程序

技術(shù)支持

其它服務(wù)

更多服務(wù)項目

聯(lián)系吧 在百度地圖上找到我們

電話：13518219792

企業(yè)網(wǎng)站建設(shè)的重要性！

聯(lián)系吧在百度地圖上找到我們