Ingénieur fiabilité des infrastructures

Reposted 2 Months Ago
Be an Early Applicant
Hiring Remotely in Montréal, QC, CAN
In-Office or Remote
Mid level
Software
The Role
The Infrastructure Reliability Engineer will maintain and optimize AWS and Kubernetes systems, ensuring availability and performance through automation and observability, as part of an interdisciplinary team.
Summary Generated by Built In

Chez Tecsys, le logiciel que nous livrons permet aux hôpitaux, pharmacies et distributeurs d'avoir ce dont ils ont besoin, quand ils en ont besoin. Chaque rôle ici contribue à ce résultat.

Pourquoi ce rôle est important

En tant que ingénieur fiabilité des infrastructures, vous vous joindrez à notre Centre des opérations réseau et de sécurité (NOC), une équipe au cœur de la fiabilité des plateformes pour les environnements SaaS critiques. Vous aiderez à maintenir, optimiser et assurer la fiabilité et la performance des systèmes qui alimentent notre infrastructure infonuagique sur AWS et Kubernetes, avec un fort accent sur l’automatisation, l’observabilité et l’amélioration continue.

Ce poste combine l’ingénierie de la fiabilité avec la gestion des incidents, vous donnant une véritable responsabilité sur la disponibilité, la performance et l’innovation. Vous ferez partie d’une équipe hautement qualifiée qui valorise la résolution créative de problèmes, l’excellence opérationnelle et l’amélioration continue grâce à l’automatisation et à l’ingénierie de la résilience.

Ce à quoi vous participerez

Tecsys est reconnue par des organisations essentielles des secteurs de la santé et de la distribution pour soutenir des chaînes d'approvisionnement résilientes, efficaces et sécurisées. Nous sommes un fournisseur mondial de logiciels infonuagiques propulsés par l'Intelligence artificielle (IA), coté à la Bourse de Toronto (TSX: TCS).

Trois valeurs guident notre façon de travailler. Nous gagnons la confiance au quotidien en valorisant le client et en agissant avec intégrité. Nous nous entraidons en reconnaissant les forces individuelles et en travaillant en équipe. Et nous explorons avec audace en restant curieux et en nous adaptant pour réussir.

Vous vous joindrez à une culture axée sur la curiosité, l'apprentissage continu et des gens qui repoussent les limites du possible.

Ce que vous ferez

  • Collaborer avec d’autres équipes d’ingénierie pour soutenir les services avant leur mise en service à travers des activités telles que la consultation en conception de systèmes, le développement de plateformes et de cadres logiciels, la planification des capacités et les revues de lancement.
  • Innover continuellement en identifiant les points faibles, en proposant des solutions créatives et en menant des initiatives qui simplifient, font évoluer et renforcent la plateforme.
  • Maintenir les services une fois qu’ils sont en ligne en mesurant et en surveillant la disponibilité, la latence et l’état général du système.
  • Assurer une observabilité optimisée : améliorer et élargir la surveillance et l’alerte à l’aide de Datadog; définir les SLO/SLI et créer des tableaux de bord exploitables qui génèrent des résultats de fiabilité.
  • Développer et favoriser l’automatisation : améliorer les outils internes, les cadres IaC et les pipelines (Terraform, GitLab CI/CD) afin de réduire les interventions manuelles et permettre des systèmes d’auto-réparation.
  • Faire évoluer les systèmes de façon durable par l’automatisation et en favorisant des changements qui améliorent la fiabilité et la rapidité.
  • Mettre en pratique une gestion durable des incidents et des analyses post-incident sans reproche. Diriger les examens post-incident (RCA) et identifier les correctifs à long terme qui améliorent la stabilité, la fiabilité et l’expérience des développeurs.
  • Mettre en œuvre la surveillance, la journalisation, l’alerte et le signalement des SLA.
  • Créer et maintenir une documentation technique.
  • Mettre en œuvre, maintenir et faire évoluer les meilleures pratiques SRE.
  • Agir comme commandant d’incident lors des incidents; coordonner la réponse interéquipes, gérer les communications et assurer une restauration rapide des services.

Autres exigences :

  • Rotation en cas d’escalade d’incidents
  • Voyages occasionnels (visites trimestrielles sur les lieux, conférences - moins de 10 %)

Requirements

Ce que vous apportez

  • Solide expérience pertinente en ingénierie de la fiabilité des sites (SRE), en infonuagique ou en DevOps dans des environnements SaaS ou de production à grande échelle
  • Solide expérience avec AWS (multicomptes, VPC, EC2, EKS) et Kubernetes à grande échelle
  • Expertise pratique de l'infrastructure en tant que code et des outils d'automatisation (Terraform, Ansible ou équivalent)
  • Expérience des pipelines CI/CD et de l'automatisation des mises en production (GitLab de préférence, Jenkins acceptable)
  • Maîtrise des outils de surveillance et d'observabilité (Datadog ou équivalent), y compris les métriques, la journalisation, les alertes et les tableaux de bord
  • Expérience de la conception, du déploiement et de l'exploitation de systèmes distribués à grande échelle et de plateformes multifournisseurs
  • Solide expérience de la gestion des incidents, y compris les rotations de garde, les escalades et les analyses post-incident
  • Solides compétences en scriptage avec Python, Bash, Java ou un langage semblable pour l'automatisation et le diagnostic
  • Connaissance des outils d'ingénierie assistés par l'IA (p. ex. Amazon Kiro) et capacité à valider efficacement leurs résultats
  • Connaissances de base des environnements de développement Java ou .NET
  • Attitude proactive, avec un sens marqué de la responsabilisation, de la résolution de problèmes et du partage des connaissances
  • Disposition à participer aux rotations de garde et à se déplacer occasionnellement au bureau (moins de 10 %)

La maitrise de l’anglais écrit et parlé, essentielle pour communiquer efficacement avec des clients, fournisseurs, partenaires d’affaires et collègues situés à l’extérieur du Québec.


Benefits

Pourquoi vous allez adorer travailler ici

  • Flexibilité axée sur le télétravail et la confiance nécessaire pour gérer votre propre horaire
  • Avantages sociaux et vacances dès le premier jour
  • Régime de retraite avec cotisation concurrentielle de l'employeur
  • Événements pour les employés et initiatives communautaires
  • Possibilités d'apprentissage, de développement et de nouveaux défis
  • Collaboration avec des équipes internationales

 Nous favorisons un milieu de travail inclusif où chacun se sent valorisé, respecté et outillé pour s'épanouir.

 Si ce rôle correspond à ce que vous recherchez, postulez dès aujourd'hui. Si vous n'êtes pas activement à la recherche d'un emploi mais souhaitez en savoir plus, il nous fera plaisir d'échanger avec vous.

Postulez dès aujourd'hui et découvrez ce que vous pourriez bâtir, résoudre et accomplir chez Tecsys!

#LI-TECSYS

Skills Required

  • Experience with cloud infrastructure and SaaS
  • Knowledge of incident management practices
  • Proficiency in monitoring and observability tools
  • Ability to automate processes with Infrastructure as Code
  • Experience with GitLab CI/CD pipelines
Am I A Good Fit?
beta
Get Personalized Job Insights.
Our AI-powered fit analysis compares your resume with a job listing so you know if your skills & experience align.

The Company
HQ: Montréal, Quebec
900 Employees
Year Founded: 1983

What We Do

Tecsys is a global provider of transformative supply chain solutions that equip growing organizations with industry-leading services and tools to achieve operational greatness.

Similar Jobs

Atlassian Logo Atlassian

Software Engineer

Cloud • Information Technology • Productivity • Security • Software • App development • Automation
Remote
Canada
11000 Employees
173K-226K Annually

Atlassian Logo Atlassian

Sales Executive

Cloud • Information Technology • Productivity • Security • Software • App development • Automation
Remote
Canada
11000 Employees
133K-173K Annually

Samsara Logo Samsara

Customer Success Manager

Artificial Intelligence • Cloud • Computer Vision • Hardware • Internet of Things • Software
Easy Apply
Remote or Hybrid
Canada
4000 Employees
99K-128K Annually

UL Solutions Logo UL Solutions

Field Engineer

Automotive • Professional Services • Software • Consulting • Energy • Chemical • Renewable Energy
Remote or Hybrid
Québec, QC, CAN
15000 Employees
65K-78K Annually

Similar Companies Hiring

Ford Energy Thumbnail
Automotive • Software • Energy • Utilities • Manufacturing • Renewable Energy
US
55 Employees
Revel Thumbnail
Aerospace • Hardware • Robotics • Software
Marina Del Rey, California
70 Employees
Blee Thumbnail
Artificial Intelligence • Marketing Tech • Software
New York, New York
30 Employees

Sign up now Access later

Create Free Account

Please log in or sign up to report this job.

Create Free Account