スキップしてメイン コンテンツに移動

Apache Hudiを巨大トラフィックのシステムに導入しようと検証して得た知見 (#19, #20)

OTF Talk は、OTF = Open Table Format の技術的な解説や最新トピック等を、ゲストをむかえてお話をうかがうPodcastです。

#19と#20では、joker1007さんに、「Apache Hudiを巨大トラフィックのシステムに導入しようと検証して得た知見」について、前後編でお話をうかがいました。

guest:@joker1007

Repro チーフアーキテクト 


host: @simosako (下佐粉 昭)

AWSのソリューションアーキテクト。 専門はデータレイク 、データウェアハウス。


※感想は #OTFTalk でポストいただけると励みになります。

※発言は各個人のものであり、所属組織を代表するものではありません。


第19回: Apache Hudiを巨大トラフィックのシステムに導入しようと検証して得た知見(前編)

既存システムとその特性/将来に向けて解消したい課題/OTF(Hudi)に着目した理由

https://creators.spotify.com/pod/show/otftalk/episodes/19-Apache-Hudi-e2rmfea

https://youtu.be/Z9kT1xmSqN4


第20回:Apache Hudiを巨大トラフィックのシステムに導入しようと検証して得た知見(後編)

Hudiを選択した背景/検証環境/インデックス設定による変化/結果と考察

https://creators.spotify.com/pod/show/otftalk/episodes/20-Apache-Hudi-e2rmfj2

https://youtu.be/cNpG_XfTRbo



参考)

joker1007さんXアカウント https://x.com/joker1007

Repro https://repro.io/


更新可能なデータレイクを構築するテーブルフォーマットApache Hudiについて (joker1007さんによるHudi解説)

https://tech.repro.io/entry/2024/07/26/141233


本番のトラフィック量でHudiを検証して見えてきた課題 (otfst_tokyo #4 でのjoker1007さん登壇資料)

https://speakerdeck.com/joker1007/ben-fan-notorahuitukuliang-dehudiwojian-zheng-sitejian-etekitake-ti


Apache HudiのMerge on Readテーブルのパフォーマンス特性とチューニングについて(上記資料の解説ブログ)

https://tech.repro.io/entry/2024/10/28/170721


コメント

このブログの人気の投稿

大規模データ分析環境での Apache Iceberg + Snowflake 活用の経験 (#33)

OTF Talk は、OTF = Open Table Format の技術的な解説や最新トピック等を、ゲストをむかえてお話をうかがうPodcastです。 第33回は、NTTドコモ 松原 侑哉 さんに、「大規模データ分析環境での Apache Iceberg + Snowflake 活用の経験」についてお話をうかがいました。 #33 大規模データ分析環境での Apache Iceberg + Snowflake 活用の経験 (2-10) https://open.spotify.com/show/27g3HFW9LcEbFlJIYqvsug ペタバイト級データを処理するインフラの変遷/Iceberg評価の背景とモチベーション/ベンチマークの方法と結果/今後について guest: NTTドコモ プリンシパルデータエンジニア  松原 侑哉 さん host: @simosako 下佐粉 昭 AWSのソリューションアーキテクト。 専門はデータレイク 、データウェアハウス。 ※感想は #OTFTalk でポストいただけると励みになります。 ※発言は各個人のものであり、所属組織を代表するものではありません。 -------------------- 参考) Apache Iceberg Meetup Japan #3 https://iceberg.connpass.com/event/364492/ 松原さん発表資料 https://speakerdeck.com/y_matsubara/apache-iceberg-meetup-japan-number-3-da-gui-mo-snowflake-plus-anoicebergnohuo-yong

Delta Lake 入門と実践事例 (#21, #22)

OTF Talk は、OTF = Open Table Format の技術的な解説や最新トピック等を、ゲストをむかえてお話をうかがうPodcastです。 #21と#22では、Databricksの桑野 章弘さんに、Delta Lakeの基本的な機能や実践事例について、お話をうかがいました。 guest: @kuwa_tw (桑野 章弘) Databricks ソリューションアーキテクト host:  @simosako  (下佐粉 昭) AWSのソリューションアーキテクト。 専門はデータレイク 、データウェアハウス。 ※感想は #OTFTalk でポストいただけると励みになります。 ※発言は各個人のものであり、所属組織を代表するものではありません。 第21回: Delta Lake 入門 OTF Talk 第21回はDatabricksの桑野 章弘さんに、「Delta Lake 入門」についてお話をうかがいました。 Delta Lakeのはじまり/商用版とOSS版の違い/Delta Lake の特徴/楽観的なトランザクション管理/Unity Catalog https://creators.spotify.com/pod/show/otftalk/episodes/21-Delta-Lake-e2sal2n https://youtu.be/rQr-pZjsh6c 第22回:Delta Lake 実践事例 OTF Talk 第22回は、Databricksの桑野 章弘さんに「Delta Lake 実践事例」についてお話をうかがいました。 Delta Lake ユースケース/機械学習もDWHも同じ環境で/事例/Delta Lakeを選択した理由 https://creators.spotify.com/pod/show/otftalk/episodes/22-Delta-Lake-e2sal3g https://youtu.be/ZP23-MeWo8o 参考) 桑野さん Xアカウント https://x.com/kuwa_tw Databrics  https://www.databricks.com/jp Delta Lakeとは? (Databricksドキュメント) https://docs.databricks.com/ja/d...

ハイトラフィックな更新処理が必要な環境でのApache Iceberg検証 (#35)

OTF Talk 第35回は、Repro チーフアーキテクトの joker1007さんに「ハイトラフィックな更新処理が必要な環境でのApache Iceberg検証」についてお話をうかがいました。 既存環境の課題/Icebergでデータとコンピュートを分離する/データ更新と参照ラグ/コンパクションの課題と工夫/今後の展望 https://open.spotify.com/show/27g3HFW9LcEbFlJIYqvsug https://youtu.be/w8rwZ-b3YNk OTF Talk は、OTF = Open Table Format の技術的な解説や最新トピック等を、ゲストをむかえてお話をうかがうPodcastです。  https://www.otftalk.com/ guest: guest: @joker100 7 Repro チーフアーキテクト  host: @simosako 下佐粉 昭 AWSのソリューションアーキテクト。 専門はデータレイク 、データウェアハウス。 ※感想は #OTFTalk でポストいただけると励みになります。 ※発言は各個人のものであり、所属組織を代表するものではありません。 -------------------- 参考) joker1007さんXアカウント - https://x.com/joker1007 ReproでのApache Icebergの技術検証結果 https://tech.repro.io/entry/2025/11/13/161646 前回のOTF Talkでのご出演 - Hudiの話 (#19, #20)  https://www.otftalk.com/2024/11/ep9.html 前回検証結果のブログ https://tech.repro.io/entry/2024/10/28/170721