Visão geral
Análise e evolução de observabilidade, SRE e custos em plataforma SaaS corporativa com +15 clusters Amazon EKS, múltiplas contas AWS e operação contínua 24x7.
Contexto
Em ambientes com muitos clusters, workloads e contas AWS, observabilidade é simultaneamente uma necessidade operacional crítica e uma parcela relevante do custo total. A plataforma precisava de sinais confiáveis para operação e troubleshooting, mas nem todo dado precisava permanecer em ferramentas de consulta cara e alta performance.
Desafio
Preservar os sinais necessários para operação, investigação de incidentes e análise de custos, sem coletar ou reter dados sem propósito claro. Equilibrar granularidade, retenção, performance de consulta e custo em múltiplas camadas de telemetria.
Minha atuação
- CloudWatch, Grafana, Loki, Datadog e Instana — dashboards, alertas e análise
- Pipelines de logs com Data Firehose, S3 e Athena para investigação de longo prazo
- Troubleshooting de Kubernetes, rede e serviços AWS com correlação multi-ferramenta
- Análise de custos: NAT Gateway, data transfer, compute sizing e plataformas de observabilidade
- SLI/SLO, análise de MTTR e root cause analysis
- Definição de políticas de retenção de logs e métricas baseadas em valor operacional
Arquitetura
A arquitetura de observabilidade considerava diferentes destinos e períodos de retenção conforme o valor operacional do dado. Sinais de alta frequência e consulta recorrente permaneciam em ferramentas de acesso rápido (CloudWatch, Grafana). Dados de investigação eventual e análise histórica eram direcionados para S3 + Athena, com custo significativamente menor. Essa separação permitia manter visibilidade operacional sem comprometer custos.
Decisões técnicas
- Granularidade de coleta orientada pelo uso real — nem todo dado precisa da mesma resolução
- Retenção proporcional à necessidade operacional e compliance
- Análise baseada em dados antes de otimizar — entender o que consume antes de reduzir
- Avaliação conjunta de compute, observabilidade e networking no impacto de custo
- Troubleshooting com correlação entre Kubernetes, infraestrutura, aplicação e rede
Automação
Consultas e processos repetíveis apoiavam a identificação de grandes consumidores de custo e a comparação entre alternativas de armazenamento e consulta. Pipelines de logs automatizados reduziam o overhead operacional de coleta e direcionamento de dados.
Desafios de engenharia
Reduzir custo de observabilidade sem eliminar sinais necessários exigia compreender padrões de acesso, investigação e operação. Dados que pareciam importantes na coleta eram frequentemente acessados apenas em incidentes específicos — e para esses, S3 + Athena oferecia capacidade suficiente com custo muito menor. A decisão arquitetural de separar camadas de retenção era parte da engenharia de plataforma, não uma otimização financeira.
Resultados
- Maior clareza sobre direcionadores de custo em observabilidade e infraestrutura
- Melhor equilíbrio entre visibilidade operacional e custo de retenção
- Pipelines de logs estruturados para investigação de longo prazo
- Decisões de otimização com contexto técnico — não apenas financeiro