Data Engineer
150 - 170 PLN/ godz.B2B
SeniorFull-time·B2B
#429435·Dodano 2 dni temu·6
Źródło: nofluffjobs.comTech Stack / Keywords
PythonDockerSQLDatabricksPySparkCI/CDSparkGCPAirflowBigQueryAPIFastAPIAzure DatabricksAzureKubernetes
Firma i stanowisko
Firma DS STREAM rozwija zaawansowany ekosystem danych w środowisku multicloud (Azure oraz GCP), stanowiący fundament dla produkcyjnych wdrożeń LLM/RAG i wyszukiwania kontekstowego. Projekt wykorzystuje m.in. Azure Databricks, GCP Vertex AI (Vector Search), Unity Catalog, Spark Structured Streaming oraz Databricks z architekturą Medallion i nowoczesnym przetwarzaniem danych niestrukturyzowanych.
Wymagania
- Bardzo dobra, zaawansowana znajomość Python i SQL do budowy skalowalnych potoków danych
- Minimum 3 lata doświadczenia praktycznego z platformą Databricks, PySpark, Delta Lake, znajomość Unity Catalog i Databricks Asset Bundles
- Doświadczenie w tworzeniu i produkcyjnym utrzymaniu DAG-ów w Apache Airflow
- Praktyczna znajomość komponentów danych w chmurze Azure (Data Factory, Databricks, Blob/ADLS, AI Search) i/lub GCP (BigQuery, Cloud Composer, Vertex AI, Cloud Storage)
- Doświadczenie w integracji danych z interfejsów API i przetwarzaniu danych w czasie rzeczywistym (Spark Structured Streaming)
- Znajomość architektur LLM/RAG, technik podziału dokumentów (chunking), pracy z embeddingami oraz bazami wektorowymi
- Znajomość narzędzi inżynierii oprogramowania: Git, Docker, CI/CD, narzędzi IaC (Terraform)
Nice to have:
- Certyfikaty: Databricks Certified Data Engineer Senior/Associate, Azure Data Engineer Associate (DP-203), Google Cloud Professional Data Engineer
Obowiązki
- Rozwój oprogramowania do skalowalnego przetwarzania dużych wolumenów danych wspierających procesy analityczne i modele AI
- Projektowanie oraz rozwój pipeline'ów danych w Databricks z wykorzystaniem PySpark i SQL
- Tworzenie i utrzymywanie pipeline'ów opartych na Spark Structured Streaming
- Projektowanie oraz zarządzanie obiektami w Unity Catalog według architektury Medallion (Bronze, Silver, Gold)
- Integracja i optymalne pobieranie danych z interfejsów API, w tym przygotowywanie danych z systemów zewnętrznych pod kątem AI
- Tworzenie procesów ETL/ELT wspierających ekstrakcję, czyszczenie, podział tekstu (chunking) i embeddowanie danych do wektorowych baz danych w chmurze (Azure AI Search, GCP Vertex AI)
Benefity
- Praca zdalna na terenie Polski z możliwością korzystania z biura w Warszawie
- Konkurencyjne wynagrodzenie na B2B
- Dostęp do budżetu szkoleniowego
- Prywatna opieka zdrowotna
- Karta sportowa
- Darmowa kawa i napoje
- Parking dla rowerów
- In-house trainings oraz hack days
- Nowoczesne biuro
- Swobodna atmosfera pracy i brak dress code'u
Karta sportowa
Dofinansowanie szkoleń
Opieka zdrowotna
Napoje w biurze
Parking dla rowerów
Szkolenia wewnętrzne
DS STREAM
6 aktywnych ofert