Corant
Blog'a Dön

Veri Boru Hatti (Data Pipeline) Kurma Rehberi: ETL mi ELT mi?

AI9 dakikalık okuma

Bir isletmenin verisi genellikle CRM, e-ticaret paneli, muhasebe yazilimi, reklam platformlari ve Excel dosyalari arasinda dagilmis halde durur. Bu dagıniklik, analitik ve yapay zeka projelerinin en buyuk gorunmez engelidir. Veri boru hatti (data pipeline), bu kaynaklari otomatik olarak toplayip temizleyerek analiz edilebilir tek bir merkeze tasiyan sistemdir. Bu yazida saglam bir veri boru hattinin nasil tasarlandigini ve ETL ile ELT arasindaki secimin pratik sonuclarini ele aliyoruz.

Veri Boru Hatti Neden Kritik?

Veri boru hatti olmadan her rapor manuel kopyala-yapistir ile hazirlanir; bu da hem zaman kaybi hem de hata kaynagidir. Otomatik bir boru hatti, verinin her sabah guncel, tutarli ve dogru formatta hazir olmasini saglar.

  • Tutarlilik: Herkes ayni tek dogru kaynaktan (single source of truth) beslenir.
  • Zaman tasarrufu: Manuel raporlama saatleri ortadan kalkar.
  • Olceklenebilirlik: Yeni bir veri kaynagi eklemek dakikalar surer.

ETL ve ELT Arasindaki Fark

ETL (Extract, Transform, Load) yaklasiminda veri once cikarilir, ayri bir katmanda donusturulup temizlenir ve ancak sonra hedef veri ambarina yuklenir. ELT (Extract, Load, Transform) ise ham veriyi once modern bir bulut veri ambarina yukler, donusumu ambarin islem gucuyle sonradan yapar.

Bugun BigQuery, Snowflake veya Redshift gibi bulut ambarlarinin ucuzlayan islem gucu nedeniyle cogu yeni proje ELT tercih ediyor. ETL ise hassas kisisel verilerin ambara girmeden maskelenmesi gereken senaryolarda hala anlamlidir.

Katman Katman Mimari

Saglam bir boru hatti genellikle uc katmanli bir yapiya oturur. Bu yaklasim, hata ayiklamayi kolaylastirir ve ham veriyi her zaman geri donebileceginiz bir referans olarak saklar.

  • Ham (raw) katman: Kaynaktan geldigi haliyle, hic dokunulmamis veri.
  • Ara (staging) katman: Temizlenmis, tip donusumleri yapilmis, standartlastirilmis veri.
  • Sunum (mart) katman: Is birimlerinin dogrudan panolara baglandigi ozet tablolar.

Batch mi Streaming mi?

Her isletmenin gercek zamanli veriye ihtiyaci yoktur. Batch (toplu) isleme, veriyi belirli araliklarla (ornegin saatte bir veya gunde bir) toplar ve cogu raporlama ihtiyacini fazlasiyla karsilar. Streaming (akis) isleme ise veriyi olustugu anda isler; dolandiricilik tespiti veya canli operasyon panolari gibi saniyelerin onemli oldugu durumlar icin gereklidir.

Pratik tavsiye: Streaming altyapisi hem maliyetli hem de karmasiktir. Gercek bir is ihtiyaci olmadan streaming'e gecmeyin; cogu KOBI icin gunde birkac kez calisan batch yeterlidir.

Guvenilirlik ve Izleme

Bir boru hatti kurmak isin yarisidir; onu ayakta tutmak diger yarisidir. Kaynak API'sinin degismesi, bir alanin bosalmasi veya beklenmedik bir veri hacmi boru hattini sessizce bozabilir. Bu yuzden izleme ve uyari mekanizmalari zorunludur.

  • Veri kalitesi testleri: Beklenen satir sayisi, bos deger orani ve tekrar eden kayit kontrolleri.
  • Basarisizlik uyarilari: Boru hatti calismadiginda ekibe otomatik bildirim.
  • Idempotentlik: Ayni is tekrar calistirildiginda cift kayit olusmamasi.

Nereden Baslamali?

Tum kaynaklari bir anda baglamaya calismak yaygin bir hatadir. En cok deger ureten tek bir soruyla baslayin: Ornegin "Musteri edinme maliyetimiz kanal bazinda nedir?" Bu soruyu cevaplamak icin gereken iki-uc kaynagi baglayin, calisan bir boru hatti kurun, sonra genisletin.

Iyi tasarlanmis bir veri boru hatti, sonraki tum analitik ve yapay zeka calismalarinizin temelidir. Verinin nereden geldigini, nasil temizlendigini ve nereye aktigini net bir sekilde tanimladiginizda, ekibiniz raporlarla degil kararlarla ugrasmaya baslar. Bu temeli dogru atmak, ilerideki her projeyi hizlandirir.