Configurerò observability e alerting

Alcune informazioni sono state tradotte automaticamente.

India

Parlo Inglese, Hindi

Specialista SRE e DevOps in Kubernetes, Terraform e Cloud

Sono un Staff Site Reliability Engineer con oltre 12 anni di esperienza pratica in DevOps, infrastrutture cloud, Kubernetes, Terraform, CI/CD, observability, automazione e affidabilità in produzione. ...
Informazioni su questo servizio

Hai bisogno di una visibilità affidabile sui tuoi sistemi, non solo di una dashboard? Configurerò, migliorerò o risolverò problemi di una soluzione di observability limitata per un'applicazione, servizio, workload, namespace o pipeline di telemetry concordata.

Un intero cluster Kubernetes è incluso solo quando le sue dimensioni, workload, fonti di telemetry e integrazioni richieste rientrano nel pacchetto scelto e sono state concordate prima dell'ordine.


In base al pacchetto e all'ambito concordato, posso aiutarti con:

  • Raccolta di metriche, log e trace
  • Configurazione di OpenTelemetry, OTLP e Grafana Alloy
  • Integrazione di Grafana, Prometheus, Loki e Alertmanager
  • Dashboard e alert azionabili
  • Definizione di SLI e SLO
  • Risolvere problemi di telemetry mancante, alert rumorosi e pipeline
  • Validazione, documentazione e consegna

Sono un Staff Site Reliability Engineer con oltre 12 anni di esperienza in DevOps e SRE. Il mio lavoro include observability in produzione, strumentazione delle applicazioni, pipeline di telemetry, risposta agli incidenti e revisioni di affidabilità.

Ogni pacchetto ha limiti definiti per ambienti, fonti di telemetry, dashboard, alert e SLO. Piattaforme multi-ambiente, multi-cluster, critiche in produzione o di grandi dimensioni richiedono discussione prima dell'ordine.

Strumenti:

Docker

GitLab

Jenkins

GitHub

BitBucket

Kubernetes

Framework:

Terraform

Ansible

Provider Cloud:

Amazon Web Services

microsoft azure

Linguaggio di programmazione:

Bash

Python

Expertise:

Installazione

Sviluppo

Configurazione