Monster Jobs lê cada vaga aberta e diz, de 0 a 100, o match dela com o seu currículo — de graça. Você está vendo esta página sem a parte mais importante dela: a sua.

?

Pode ser 94. Pode ser 31.

O ponteiro só crava quando lemos o seu currículo. Leva 1 minuto, de graça.

DOSSIÊ MJ-0734 · ACESSO PARCIAL

SRE de Plataforma de IA

SRM ASSET · São Paulo, SP

PresencialNão informadoGerente

Esta é 1 de 69.026 vagas encontradas nos últimos 30 dias. Nós comparamos todas com o seu currículo — hoje, esta página nem sabe quem você é.

Grátis, sem cartão. Só o seu currículo.

Encontrada há 3 semanas

Se candidatar no escuro custa uma noite.
Saber custa um minuto.

A conta que ninguém faz

Você, sozinho, numa noite

~20

vagas abertas e lidas uma a uma — a maioria descartada no terceiro parágrafo, quando o requisito que você não tem finalmente aparece. Dias assim, toda semana.

O Monster Jobs, enquanto isso

69.026

vagas já lidas e entendidas, prontas para ganhar nota contra o seu currículo no momento em que ele chegar. Você não procura mais vaga — recebe as que merecem a sua atenção.

Recrutador faz triagem de candidato.
Aqui, o recrutador é você — de vagas.

Cada uma chega com nota e motivo. Seu único trabalho é dizer sim ou não.

RELATÓRIO DE COMPATIBILIDADE · GERADO POR VAGA, POR PESSOA

Por que essa nota

Para quem tem conta, este bloco explica a nota em português — escrito sobre o seu histórico, não um texto genérico:

O raciocínio da nota é gerado para cada currículo depois do cadastro gratuito.

Aderência técnicapeso 0.45
Senioridadepeso 0.25
Localização e modelo de trabalhopeso 0.2
Setor e contextopeso 0.1

A seu favor

O que do seu histórico pesa a favor aqui.

O que falta

O que a vaga pede e seu currículo ainda não mostra.

Liberar meu relatório grátis

1 minuto: você envia o currículo, nós escrevemos o resto.

Ninguém caça sozinho. Esta vaga foi encontrada por outra pessoa e entrou no acervo de todo mundo. A caça continua enquanto você lê isto — e a sua parte do acervo (69.026 vagas, comparadas com o seu currículo) só passa a existir quando você entra.

O que você decide sobre cada vaga

Cada vaga vira um caso com histórico: candidatei, entrevista, proposta. Estes botões são os reais — só falta a conta.

Descrição da vaga

Missão da posição

Projetar, construir, automatizar e operar a Plataforma de Engenharia de IA, garantindo que aplicações, modelos, LLMs, agentes e serviços de IA possam ser desenvolvidos e executados com segurança, observabilidade, escalabilidade, confiabilidade e governança.

O profissional atuará na interseção entre SRE, Platform Engineering, DevOps, Cloud, Observabilidade e AI Engineering, construindo a camada de infraestrutura e automação necessária para transformar iniciativas de IA em serviços produtivos e sustentáveis.

A posição terá forte atuação em AWS, Kubernetes, GitOps, Infrastructure as Code, CI/CD, Observabilidade e AI Observability.

Principais responsabilidades

  • Plataforma AWS

Projetar, administrar e evoluir a infraestrutura AWS utilizada pela plataforma de IA.

Responsabilidades:

  • Administração e evolução de ambientes AWS.
  • Arquitetura de workloads distribuídos e altamente disponíveis.
  • Administração de EKS.
  • ECR para gerenciamento de imagens.
  • S3 para datasets, artefatos, modelos e logs.
  • IAM e políticas de acesso.
  • Secrets Manager e Parameter Store.
  • Load Balancers e networking.
  • Route 53.
  • CloudWatch.
  • SQS/SNS/EventBridge para arquiteturas orientadas a eventos.
  • RDS/Aurora e serviços de persistência quando necessários.
  • ElastiCache/Redis.
  • Integração com serviços de IA da AWS.
  • Gestão de custos, capacidade e eficiência dos workloads.

O profissional deverá aplicar conceitos de:

High Availability, Disaster Recovery, Security by Design, FinOps e Well-Architected Framework.

  • Kubernetes e Plataforma de Containers

Construir e operar clusters Kubernetes utilizados pelos serviços e workloads de IA.

Principais atividades:

  • Administração de clusters Amazon EKS.
  • Helm.
  • Kubernetes Operators.
  • Ingress Controllers.
  • Service Accounts e RBAC.
  • Network Policies.
  • Secrets.
  • Persistent Volumes.
  • Autoscaling.
  • HPA.
  • KEDA.
  • Cluster Autoscaler/Karpenter.
  • Troubleshooting de workloads Kubernetes.
  • Capacity Planning.

Também será responsável por definir padrões de deployment para:

  • APIs de IA;
  • serviços Python;
  • aplicações Java;
  • agentes de IA;
  • gateways;
  • workers;
  • pipelines assíncronos;
  • aplicações de inferência;
  • ferramentas internas da plataforma.
  • Infrastructure as Code

Toda infraestrutura deverá ser tratada como código.

Stack principal:

Terraform / OpenTofu + Terragrunt + Atlantis

Responsabilidades:

  • desenvolvimento de módulos reutilizáveis;
  • versionamento da infraestrutura;
  • revisão de mudanças via Pull Request;
  • execução automatizada de Plan;
  • aprovação controlada de Apply;
  • gestão de múltiplos ambientes;
  • padronização de módulos;
  • controle de drift;
  • políticas de segurança;
  • automação do ciclo de vida da infraestrutura.

O Atlantis deverá funcionar como camada de governança do processo de IaC.

Fluxo esperado:

Developer

↓

Pull Request

↓

GitHub

↓

Atlantis

↓

Terraform / OpenTofu

↓

AWS

  • GitOps e Continuous Delivery

Responsável pela implementação e evolução do modelo GitOps da plataforma.

Stack principal:

GitHub + GitHub Actions + ArgoCD + Helm

Fluxo esperado:

Developer

↓

GitHub

↓

GitHub Actions

↓

Build / Test / Security

↓

Container Image

↓

Amazon ECR

↓

GitOps Repository

↓

ArgoCD

↓

Amazon EKS

Responsabilidades:

  • construção de pipelines CI/CD;
  • criação de workflows reutilizáveis;
  • gerenciamento de secrets;
  • integração com ECR;
  • deployment GitOps;
  • estratégias de rollback;
  • promoção entre ambientes;
  • controle de versões;
  • políticas de aprovação.

Desejável conhecimento de:

  • Argo Rollouts;
  • Blue/Green Deployment;
  • Canary Deployment;
  • Progressive Delivery.
  • Observabilidade da Plataforma

Responsável por implementar observabilidade completa dos workloads.

Stack principal:

OpenTelemetry + Datadog

A plataforma deverá coletar:

  • Metrics
  • Logs
  • Traces
  • Events

O OpenTelemetry deverá ser utilizado como camada de instrumentação e coleta independente de fornecedor.

Arquitetura esperada:

Applications

AI Services

AI Agents

Kubernetes

↓

OpenTelemetry SDK

↓

OpenTelemetry Collector

↓

Datadog

Responsabilidades:

  • instrumentação OpenTelemetry;
  • administração de OpenTelemetry Collectors;
  • distributed tracing;
  • dashboards;
  • alertas;
  • correlação entre logs, métricas e traces;
  • definição de SLIs e SLOs;
  • monitoração de disponibilidade;
  • monitoração de performance;
  • análise de incidentes;
  • troubleshooting distribuído.
  • AI Observability / LLM Observability

Um dos diferenciais da posição será operar a camada de observabilidade específica para Inteligência Artificial.

Além da observabilidade tradicional, deverão ser acompanhados indicadores como:

  • Latência de inferência.
  • Time to First Token.
  • Tokens de entrada.
  • Tokens de saída.
  • Custo por requisição.
  • Custo por modelo.
  • Custo por aplicação/agente.
  • Taxa de erro.
  • Falhas de ferramentas.
  • Retries.
  • Context size.
  • Model/provider utilizado.
  • Consumo por usuário ou aplicação.
  • Qualidade das respostas.
  • Avaliações de LLM.
  • Traces de agentes.

Para arquiteturas Agentic AI:

User Request

↓

Agent

↓

LLM

↓

Tool

↓

Agent

↓

Another Agent

↓

LLM

↓

Response

O profissional deverá ser capaz de reconstruir e diagnosticar todo esse fluxo através de traces.

Conhecimentos desejáveis:

  • OpenTelemetry GenAI Semantic Conventions;
  • OpenLIT;
  • Langfuse;
  • Arize Phoenix;
  • avaliação e tracing de aplicações LLM.
  • Plataforma de Engenharia de IA

O profissional participará da construção de uma Internal Developer Platform — IDP direcionada para workloads de IA.

Objetivo:

Permitir que desenvolvedores e times de IA publiquem serviços sem precisar conhecer toda a complexidade da infraestrutura.

Exemplo:

Developer

↓

Developer Portal

↓

Service Template

↓

GitHub Repository

↓

GitHub Actions

↓

ECR

↓

ArgoCD

↓

EKS

↓

OpenTelemetry

↓

Datadog

A plataforma deverá fornecer Golden Paths para criação de:

  • APIs;
  • microserviços;
  • workers;
  • aplicações Python;
  • serviços Java;
  • agentes de IA;
  • aplicações RAG;
  • serviços de inferência.

Cada Golden Path deverá entregar automaticamente:

  • repositório;
  • pipeline;
  • Dockerfile;
  • Helm Chart;
  • deployment Kubernetes;
  • observabilidade;
  • health checks;
  • secrets;
  • dashboards;
  • alertas;
  • políticas básicas de segurança.
  • AI Gateway e acesso aos modelos

Participará da construção da camada de abstração entre aplicações e provedores/modelos de IA.

Arquitetura conceitual:

Applications

Agents

Services

↓

AI Gateway

↓

Model Router

↓

┌──────────────┬──────────────┬──────────────┐

│ AWS Bedrock │ External LLM │ Local Models │

└──────────────┴──────────────┴──────────────┘

Essa camada deverá permitir:

  • autenticação;
  • rate limiting;
  • quotas;
  • auditoria;
  • observabilidade;
  • controle de custos;
  • roteamento de modelos;
  • fallback entre modelos;
  • políticas de utilização.
  • Confiabilidade e SRE

Aplicar princípios de Site Reliability Engineering em toda a plataforma.

Responsabilidades:

  • definição de SLIs;
  • definição de SLOs;
  • Error Budgets;
  • Incident Management;
  • Capacity Planning;
  • Performance Engineering;
  • Chaos Engineering;
  • Postmortems;
  • Runbooks;
  • automação de troubleshooting;
  • redução de Toil.

Indicadores importantes:

Availability

Latency

Error Rate

Saturation

Throughput

MTTR

MTBF

Deployment Frequency

Change Failure Rate

  • Automação e Engenharia

O profissional deverá possuir capacidade de automação utilizando principalmente:

  • Python;
  • Shell Script;
  • YAML;
  • Terraform/OpenTofu.

Conhecimento de Java será considerado diferencial para troubleshooting de aplicações corporativas.

Deverá ser capaz de desenvolver:

  • automações operacionais;
  • ferramentas internas;
  • APIs;
  • integrações;
  • health checks;
  • collectors;
  • scripts de troubleshooting;
  • automações de incident response.
  • Segurança e Governança

Implementar práticas de segurança integradas à plataforma.

Principais conceitos:

  • IAM Least Privilege;
  • RBAC;
  • Secrets Management;
  • Workload Identity;
  • OIDC;
  • Supply Chain Security;
  • Image Scanning;
  • SAST;
  • Dependency Scanning;
  • IaC Scanning;
  • Policy as Code;
  • auditoria de alterações.

A plataforma deverá priorizar:

Zero Trust + Security by Design + Everything as Code.

Stack tecnológica principal

Cloud

AWS

Containers

Kubernetes

Amazon EKS

Docker

Helm

Infrastructure as Code

Terraform

OpenTofu

Terragrunt

Atlantis

CI/CD e GitOps

GitHub

GitHub Actions

ArgoCD

Argo Rollouts

Observabilidade

OpenTelemetry

Datadog

Prometheus

Grafana

AI Observability

OpenTelemetry GenAI

OpenLIT

Langfuse

Arize Phoenix

AI Platform

AWS Bedrock

LLM APIs

RAG

Vector Databases

AI Agents

Model Gateways

Automação

Python

Shell Script

Competências esperadas

O profissional deverá possuir forte capacidade de:

  • troubleshooting;
  • análise de sistemas distribuídos;
  • automação;
  • arquitetura cloud;
  • Kubernetes;
  • observabilidade;
  • engenharia de confiabilidade;
  • Infrastructure as Code;
  • GitOps.

Mais importante que administrar ferramentas isoladamente será compreender como todo o ecossistema se relaciona.

Visão da posição

O objetivo final dessa função é transformar IA de um conjunto de experimentos isolados em uma capacidade corporativa de engenharia.

A plataforma deverá permitir que um desenvolvedor consiga sair de:

Código

para:

Código

↓

Pipeline

↓

Infraestrutura

↓

Deployment

↓

Observabilidade

↓

Segurança

↓

Operação

com o máximo possível desse processo automatizado.

O SRE de Plataforma de IA será responsável por construir e manter essa fundação.

Em resumo:

Developers constroem aplicações de IA.

AI Engineers constroem modelos, agentes e pipelines de IA.

O SRE / Platform Engineer de IA constrói a plataforma que permite que tudo isso chegue à produção de forma confiável, observável, segura e escalável. Show more Show less
Vale a pena me candidatar? Ver minha nota

Leu tudo e ficou na dúvida? É exatamente isso que a nota resolve.

Por que criar conta agora

Leva 1 minuto

Envie o currículo e pronto. Sem formulário longo, sem questionário, sem teste.

Grátis de verdade

Sem cartão, sem período de teste que expira. Seu currículo só gera as suas notas.

Já tem vaga esperando

69.026 vagas encontradas nos últimos 30 dias — a sua nota nesta e em todas as outras sai assim que o currículo chega.

Criar conta grátis