Irth Solutions
Irth Solutions

Data Engineer RD-017

datafull timeCanada
SALARY
Not listed
WORK TYPE
remote
JOB TYPE
full time
INDUSTRY
general
Apply for this position
✦ AutoApply Let us apply to roles like this on your behalf.
Learn more

About the role

Data Engineer (Mid-level)

Remote (Quebec/Canada)

About Irth Solutions

Irth Solutions is a leading provider of cloud-based SaaS software for damage prevention, asset integrity, stakeholder engagement and land management, helping energy, utility, telecom, and infrastructure companies protect their critical network infrastructure. With nearly three decades of industry experience, Irth serves customers across North America and continues to expand its platform with new data-driven and AI-powered capabilities.

About the Role

We are looking for a Data Engineer to design, build, and maintain data ingestion and processing pipelines in Databricks, transforming high-volume external data sources into clean, structured, reliable inputs for downstream analysis and intelligence. This role will primarily support our Stakeholder Engagement offering, working closely with our Data Scientist and application teams.

Key responsibilities

1. Data Pipeline Development (Primary Responsibility)

  • Design, build, and maintain ingestion pipelines from high-volume external APIs, capable of running continuously and reliably at scale.
  • Implement ingestion and transformation workflows using Databricks (Spark/PySpark, SQL, Delta Live Tables), applying medallion architecture patterns (Bronze → Silver → Gold) to move from raw ingested content to clean, structured, analysis-ready data.
  • Build the infrastructure for deduplication and relevance filtering of incoming content, implementing filtering logic and quality criteria defined in collaboration with the Data Scientist.
  • Implement schema evolution handling and data validation rules as data sources and formats change over time.

2. Platform & Storage Implementation

  • Configure and manage Delta Lake storage structures, tables, partitions, and optimization routines (OPTIMIZE, Z-ORDER, VACUUM).
  • Design and evolve data schemas that balance query performance, cost, and maintainability as data volume grows.
  • Maintain clear metadata and documentation of table structures to support easy consumption by the Data Science and application teams.

3. Reliability, Monitoring & Operational Support

  • Ensure pipeline reliability and observability: error handling, retries, monitoring, and alerting for a continuously running system.
  • Adapt pipelines to evolving external API contracts, rate limits, authentication changes, and new data sources.
  • Troubleshoot pipeline failures, perform recovery, and tune performance as needed.

4. Orchestration & Automation

  • Build, schedule, and monitor workflows using Databricks Workflows, Delta Live Tables, or similar orchestration tools.
  • Contribute to CI/CD pipelines for code deployment, versioning, and environment management.

5. Collaboration & Documentation

  • Work closely with the Data Scientist to expose clean, well-structured data feeding LLM/NLP pipelines and downstream models.
  • Participate in technical decisions around data architecture and propose structuring solutions as the team's needs evolve.
  • Document pipelines, data dictionaries, job schedules, and transformation logic.
  • Support the onboarding of new data sources and pipelines as the product expands to additional solution areas.

Ingénieur(e) de données (Intermédiaire)

Lieu : Télétravail (Québec/Canada)

À propos d'Irth Solutions

Irth Solutions est un fournisseur de premier plan de logiciels SaaS infonuagiques pour la prévention des dommages, l'intégrité des actifs, la mobilisation des parties prenantes et la gestion foncière, aidant les entreprises des secteurs de l'énergie, des services publics, des télécommunications et des infrastructures à protéger leurs réseaux d'infrastructure critiques. Avec près de trois décennies d'expérience dans l'industrie, Irth dessert des clients à travers l'Amérique du Nord et continue d'élargir sa plateforme avec de nouvelles capacités axées sur les données et l'intelligence artificielle.

À propos du poste

Nous sommes à la recherche d'un(e) ingénieur(e) de données pour concevoir, construire et maintenir des pipelines d'ingestion et de traitement de données dans Databricks, transformant des sources de données externes à haut volume en données propres, structurées et fiables pour l'analyse et l'intelligence en aval. Ce poste appuiera principalement notre offre de mobilisation des parties prenantes (Stakeholder Engagement), en collaboration étroite avec notre data scientist et les équipes de développement applicatif.

Responsabilités principales

1. Développement de pipelines de données (responsabilité principale)

  • Concevoir, construire et maintenir des pipelines d'ingestion à partir d'API externes à haut volume, capables de fonctionner de façon continue et fiable à grande échelle.
  • Implémenter des flux d'ingestion et de transformation avec Databricks (Spark/PySpark, SQL, Delta Live Tables), en appliquant les patrons d'architecture medallion (Bronze → Silver → Gold) pour transformer le contenu brut ingéré en données propres, structurées et prêtes pour l'analyse.
  • Construire l'infrastructure de déduplication et de filtrage de pertinence du contenu entrant, en implémentant la logique de filtrage et les critères de qualité définis en collaboration avec le data scientist.
  • Implémenter la gestion de l'évolution des schémas et des règles de validation des données, à mesure que les sources et formats de données évoluent.

2. Implémentation de la plateforme et du stockage

  • Configurer et gérer les structures de stockage Delta Lake, les tables, le partitionnement et les routines d'optimisation (OPTIMIZE, Z-ORDER, VACUUM).
  • Concevoir et faire évoluer des schémas de données qui équilibrent performance des requêtes, coûts et facilité de maintenance à mesure que le volume de données croît.
  • Maintenir une documentation claire des métadonnées et des structures de tables afin de faciliter leur utilisation par les équipes de data science et de développement applicatif.

3. Fiabilité, surveillance et soutien opérationnel

  • Assurer la fiabilité et l'observabilité des pipelines : gestion des erreurs, mécanismes de reprise (retries), surveillance et alertes pour un système fonctionnant en continu.
  • Adapter les pipelines aux changements des contrats d'API externes, des limites de taux (rate limits), des méthodes d'authentification et à l'ajout de nouvelles sources de données.
  • Diagnostiquer les défaillances des pipelines, effectuer les reprises nécessaires et optimiser la performance au besoin.

4. Orchestration et automatisation

  • Construire, planifier et surveiller des flux de travail avec Databricks Workflows, Delta Live Tables ou des outils d'orchestration équivalents.
  • Contribuer aux pipelines CI/CD pour le déploiement du code, la gestion des versions et des environnements.

5. Collaboration et documentation

  • Collaborer étroitement avec le data scientist pour fournir des données propres et bien structurées alimentant les pipelines LLM/NLP et les modèles en aval.
  • Participer aux décisions techniques liées à l'architecture des données et proposer des solutions structurantes à mesure que les besoins de l'équipe évoluent.
  • Documenter les pipelines, les dictionnaires de données, les calendriers d'exécution et la logique de transformation.
  • Appuyer l'intégration de nouvelles sources et pipelines de données à mesure que le produit s'étend à d'autres domaines de solutions.

Exigences

Forte préférence pour les candidat(e)s résidant au Québec, la maîtrise du français (parlé et écrit) constituant un atout important en plus de l'anglais.

✦ Let us apply for you
We find roles like this and apply on your behalf. Cover letter written for each one. Plans from $15/mo. Cancel anytime.
Get AutoApply
Apply now
Data Engineer RD-017 at Irth Solutions — Remote