SRE / Observability / FinOps

Cloud Observability, SRE & Cost Optimization

Observabilidade multi-ferramenta, pipelines de logs e análise de custos em plataforma SaaS com +15 clusters EKS e operação 24x7.

AWSCloudWatchGrafanaLokiDatadogInstana
01

Visão geral

Análise e evolução de observabilidade, SRE e custos em plataforma SaaS corporativa com +15 clusters Amazon EKS, múltiplas contas AWS e operação contínua 24x7.

02

Contexto

Em ambientes com muitos clusters, workloads e contas AWS, observabilidade é simultaneamente uma necessidade operacional crítica e uma parcela relevante do custo total. A plataforma precisava de sinais confiáveis para operação e troubleshooting, mas nem todo dado precisava permanecer em ferramentas de consulta cara e alta performance.

03

Desafio

Preservar os sinais necessários para operação, investigação de incidentes e análise de custos, sem coletar ou reter dados sem propósito claro. Equilibrar granularidade, retenção, performance de consulta e custo em múltiplas camadas de telemetria.

04

Minha atuação

  • CloudWatch, Grafana, Loki, Datadog e Instana — dashboards, alertas e análise
  • Pipelines de logs com Data Firehose, S3 e Athena para investigação de longo prazo
  • Troubleshooting de Kubernetes, rede e serviços AWS com correlação multi-ferramenta
  • Análise de custos: NAT Gateway, data transfer, compute sizing e plataformas de observabilidade
  • SLI/SLO, análise de MTTR e root cause analysis
  • Definição de políticas de retenção de logs e métricas baseadas em valor operacional
05

Arquitetura

A arquitetura de observabilidade considerava diferentes destinos e períodos de retenção conforme o valor operacional do dado. Sinais de alta frequência e consulta recorrente permaneciam em ferramentas de acesso rápido (CloudWatch, Grafana). Dados de investigação eventual e análise histórica eram direcionados para S3 + Athena, com custo significativamente menor. Essa separação permitia manter visibilidade operacional sem comprometer custos.

Arquitetura conceitual — detalhes intencionalmente generalizados
Applications / AWS / Kubernetes→
Collection→
CloudWatch / Grafana→
Firehose→
S3→
Athena / Investigation
DatadogInstanaLoki
06

Decisões técnicas

  • Granularidade de coleta orientada pelo uso real — nem todo dado precisa da mesma resolução
  • Retenção proporcional à necessidade operacional e compliance
  • Análise baseada em dados antes de otimizar — entender o que consume antes de reduzir
  • Avaliação conjunta de compute, observabilidade e networking no impacto de custo
  • Troubleshooting com correlação entre Kubernetes, infraestrutura, aplicação e rede
07

Automação

Consultas e processos repetíveis apoiavam a identificação de grandes consumidores de custo e a comparação entre alternativas de armazenamento e consulta. Pipelines de logs automatizados reduziam o overhead operacional de coleta e direcionamento de dados.

08

Desafios de engenharia

Reduzir custo de observabilidade sem eliminar sinais necessários exigia compreender padrões de acesso, investigação e operação. Dados que pareciam importantes na coleta eram frequentemente acessados apenas em incidentes específicos — e para esses, S3 + Athena oferecia capacidade suficiente com custo muito menor. A decisão arquitetural de separar camadas de retenção era parte da engenharia de plataforma, não uma otimização financeira.

09

Resultados

  • Maior clareza sobre direcionadores de custo em observabilidade e infraestrutura
  • Melhor equilíbrio entre visibilidade operacional e custo de retenção
  • Pipelines de logs estruturados para investigação de longo prazo
  • Decisões de otimização com contexto técnico — não apenas financeiro