Big Data Engineer
Podsumowanie oferty

(Podsumowanie wygenerowane przez AI na bazie pełnej treści ogłoszenia rekrutacyjnego)

Projekt dotyczy budowy i utrzymania rozwiązań Lakehouse w Azure Databricks z wykorzystaniem PySpark, Delta Lake i Unity Catalog. Wymagana praktyczna praca z Spark Structured Streaming, CDC (Debezium/Kafka) oraz integracja z relacyjnymi bazami (Oracle, SQL Server, PostgreSQL). Odpowiedzialność obejmuje projektowanie pipeline’ów batchowych i strumieniowych, materializację warstw Medallion (bronze/silver/gold), zapewnienie idempotentności, deduplikacji i poprawnej kolejności zdarzeń, optymalizację wydajności i kosztów, monitoring i alertowanie, opis danych w katalogu OpenMetadata oraz utrzymanie kodu w GitLab z CI/CD.

od: 21 września 2026
do: 21 października 2026
brak widełekumowa o pracę (pełny etat)
Parametry oferty
poziom:mid • senior
tryb pracy: hybrydowa
lokalizacja:Warszawa, mazowieckie
Warszawa, mazowieckie

Wymagania

Technologie wymagane

Databricks
Kafka

Nasze wymagania

  • Praktyczne doświadczenie w Azure Databricks: joby, klastry, Delta Lake, Unity Catalog,
  • Bardzo dobra znajomość Apache Spark i PySpark, w tym Spark Structured Streaming,
  • Umiejętność diagnozowania i optymalizacji wydajności procesów Spark oraz layoutu tabel Delta (partycjonowanie, compaction, ewolucja schematu).
  • Znajomość podstaw Apache Kafka: topics, partitions, consumer groups, offsets, Schema Registry, formaty Avro/JSON,
  • Rozumienie mechanizmów Change Data Capture i replikacji zmian z relacyjnych baz danych,
  • Umiejętność projektowania procesów idempotentnych, odpornych na duplikaty, zmianę kolejności i ponowne przetwarzanie zdarzeń.
  • Bardzo dobra znajomość SQL i Pythona w kontekście przetwarzania danych,
  • Doświadczenie w pracy z SQL Server i/lub Oracle,
  • Znajomość architektury Lakehouse i wzorca Medallion,
  • Rozumienie zagadnień jakości, kompletności i śledzenia pochodzenia danych (lineage).
  • Git, CI/CD (GitLab CI, Azure DevOps lub podobne), testy jednostkowe i integracyjne procesów danych,
  • Rozumienie modelu tożsamości i sekretów w Azure (Entra ID, Key Vault) w stopniu pozwalającym bezpiecznie budować rozwiązania.

Mile widziane

  • Samodzielność w analizie złożonych problemów w rozproszonych systemach danych,
  • Świadomość wpływu decyzji architektonicznych na wydajność, koszt, bezpieczeństwo i utrzymanie,
  • Projektowanie rozwiązań z myślą o ich obserwowalności i późniejszym utrzymaniu,
  • Jasna komunikacja i dokumentowanie decyzji technicznych - zarówno dla zespołów technicznych, jak i biznesu.

Twój zakres obowiązków

  • Projektowanie i rozwój pipeline'ów batchowych i strumieniowych w Azure Databricks (PySpark, Structured Streaming, Delta Lake),
  • Konsumowanie strumieni CDC (Debezium/Kafka) i ich materializacja w warstwach Lakehouse z zachowaniem poprawności (deduplikacja, kolejność zdarzeń, ponowne przetwarzanie),
  • Integracja danych z relacyjnych baz danych (Oracle, SQL Server, PostgreSQL), API i systemów plikowych,
  • Projektowanie struktur danych w architekturze Medallion (bronze / silver / gold) w Unity Catalog,
  • Optymalizacja wydajności i kosztów przetwarzania (partycjonowanie, layout tabel, dobór klastrów),
  • Monitoring pipeline'ów, alertowanie, diagnozowanie problemów z wydajnością, dostępnością i jakością danych,
  • Opisywanie danych w katalogu OpenMetadata: własność, klasyfikacja, kontrakty danych, produkty danych,
  • Utrzymanie kodu w GitLab z CI/CD (Databricks Asset Bundles), testy, code review,
  • Współpraca z właścicielami systemów źródłowych, zespołami BI, Data Science i odbiorcami biznesowymi,
  • Udział w kształtowaniu standardów technicznych platformy.
Company

To oferujemy

  • Stabilne warunki zatrudnienia i przyjazna atmosfera pracy.
  • Pracę hybrydową z naszego biura, znajdującego się w Galerii Młociny.
  • Możliwość rozwoju zawodowego w strukturach wewnętrznych.
  • Możliwość skorzystania z benefitów pozapłacowych na preferencyjnych warunkach.
  • Możliwość współpracy z zespołem ekspertów.
  • Zniżkę pracowniczą na części samochodowe grupy Inter Cars.
  • Szkolenia wewnętrzne i zewnętrzne rozwijające

Grupa Kapitałowa Inter Cars

Dołącz do zespołu budującego Operational Analytics Platform (OAP) – platformę danych Inter Cars działającą w przeszło 20 krajach Europy. Platforma składa się z trzech elementów: replikacji danych w czasie zbliżonym do rzeczywistego (Debezium → Kafka → Spark Structured Streaming), środowiska analitycznego Azure Databricks (Lakehouse, Unity Catalog) oraz katalogu danych OpenMetadata obejmującego całą grupę. Szukamy osoby, która będzie projektować i rozwijać pipeline'y danych na tej platformie – od strumieni CDC z systemów źródłowych, przez warstwy Lakehouse, po dane produktowe udostępniane zespołom biznesowym, BI i Data Science. Pracujemy w modelu hybrydowym: systemy źródłowe i Kafka on-premise, przetwarzanie i analityka w Azure.
Big Data Engineer
Zgłaszam się do:
Grupa Kapitałowa Inter Cars
Warszawa, mazowieckie
Pracodawca zbiera zgłoszenia przez swój system.
Przejdziesz na zewnętrzny formularz.

Klikając w przycisk „Aplikuj” potwierdzasz, że zapoznałeś(‑łaś) się i akceptujesz Regulamin serwisu.



This site is protected by reCAPTCHA and the Google Privacy Policy and Terms of Service apply.

Brakuje Ci informacji?

  • Upewnij się, że w treści nie ma tego, czego szukasz.
  • Zadaj pytanie, jeśli potrzebujesz więcej szczegółów dotyczących powyższej oferty.
  • Przekażemy Twoje pytanie do pracodawcy i postaramy się dostarczyć odpowiedź w ciągu 3 dni roboczych.

Udostępnij ofertę