Przewodniki krok po kroku z gotowymi komendami.
Napraw błędy AccessDenied w AgentCore Identity, gdy agent działa w imieniu użytkownika: propagacja tożsamości, sejf tokenów OAuth (2LO/3LO), workload identity oraz niedopasowanie zakresu least-privilege.
Napraw pusty lub nieaktualny odczyt AgentCore Memory: asynchroniczna konsolidacja pamięci długoterminowej, różnica między pamięcią krótko i długoterminową, zakres actor/session oraz niedopasowanie namespace.
Napraw timeouty wywołań AgentCore Runtime: limit inicjalizacji przy zimnym starcie, kontrakt kontenera (port 8080 i /invocations), architektura ARM64 i 15-minutowy timeout sesji.
Napraw błąd 401/403 na AgentCore Gateway przy wywołaniach narzędzi MCP: sprawdź claim audience w tokenie wejściowym, sam token oraz wychodzący credential provider OAuth2.
Naprawa błędów aplikowania zmian w ciągłym tasku AWS DMS do Redshift lub S3: diagnoza stl_load_errors, przepełnienia VARCHAR, uprawnień IAM/S3 i sizingu instancji dla strumienia CDC utrzymywanego bezterminowo.
Naprawa rosnącego opóźnienia CDC i awarii taska AWS DMS: diagnoza CDCLatencySource vs CDCLatencyTarget, tabele bez klucza głównego, obcięcie LOB i sizing instancji replikacyjnej.
Poprawna konfiguracja AWS RDS Proxy: MaxConnectionsPercent, zarządzanie idle connections, unikanie pinningu i scenariusze, w których RDS Proxy szkodzi bardziej niż pomaga.
Naprawa CloudWatch Alarm który się nie uruchamia: INSUFFICIENT_DATA z powodu brakujących metryk, złe okresy ewaluacji, brak uprawnień SNS i obsługa brakujących danych.
Naprawa Prometheus OOMKilled: identyfikacja metryk o wysokiej kardynalności, konfiguracja metric_relabel_configs do odrzucania zbędnych serii, limity serii czasowych i doboru pamięci.
Identyfikacja i redukcja cloud sprawl: audyt osieroconych zasobów, nieużywanych kont, nieoznakowanej infrastruktury i zduplikowanych usług. Komendy CLI dla AWS, GCP i Azure z szacunkiem odzyskanych kosztów.
Diagnoza i naprawa wysokiego zużycia CPU/pamięci przez Datadog Agent: wyłączenie zbędnych integracji, ograniczenie custom metrics, konfiguracja logów i przejście na Cluster Agent.
Diagnoza i naprawa odrzuconego deployment w GKE spowodowanego przez Binary Authorization: brak poświadczenia, niezgodność klucza attestor, użycie tag zamiast digest, brak anotacji break-glass.
Diagnoza i naprawa zablokowanych request API przez VPC Service Controls: weryfikacja access level, konfiguracja perymetru, ingress/egress rules, audit logi VPC-SC.
Diagnoza i naprawa spadku utilization AWS Savings Plans poniżej 80%: identyfikacja przyczyn (scale-down, migracja, wrong region, sezonowość) i strategie odzyskania wartości commitment.
Naprawa spadku wydajności vLLM po godzinach pracy: diagnoza fragmentacji KV cache, włączenie prefix caching, tuning gpu-memory-utilization i cykliczny restart.
Diagnoza niedziałającego GCP CUD: weryfikacja machine family, regionu, typu commitment (compute vs memory-optimized), sprawdzenie billing export i naprawa.
Naprawa zapytań BigQuery zablokowanych w kolejce: weryfikacja capacity commitment, assignment, concurrency i autoscaling slotów.
Rozwiązanie błędu 429 w Azure OpenAI: identyfikacja wąskiego gardła (TPM vs RPM), wdrożenie retry logic, zwiększenie quota lub przejście na PTU.
Naprawa blokowania Service Principal przez Conditional Access: analiza Sign-in Logs, wykluczenie workload identities z polityk, konfiguracja Workload Identity Premium.
Naprawa błędu Access Denied w Bedrock Knowledge Base sync: weryfikacja IAM role trust, KMS key policy, S3 bucket policy i VPC endpoint policy.
Naprawa błędów połączenia Azure Database Migration Service: weryfikacja NSG, firewall rules, Self-Hosted Integration Runtime i konfiguracji sieci źródłowej.
Naprawa rozwiązywania DNS w App Service z VNet Integration: konfiguracja Private DNS Zones, VNet link i WEBSITE_DNS_SERVER.
Naprawa Terraform drift po manualnych zmianach w konsoli: identyfikacja zmienionych zasobów, import lub reset do pożądanego stanu, wdrożenie wykrywania drift i policy.
Naprawa ECS Task OOMKilled: identyfikacja przyczyny przekroczenia limitu pamięci, dobór rozmiaru task definition, konfiguracja rezerwacji pamięci i limity twarde/miękkie.
Naprawa podów vLLM kończących z CUDA OutOfMemoryError na EKS. Diagnostyka przepełnienia KV cache, dostrajanie parametrów pamięci, zmiana kwantyzacji.
Rozwiązanie degradacji opóźnień w wyszukiwaniu wektorowym w OpenSearch Serverless spowodowanej nasyceniem OCU.
Rozwiązanie błędów ThrottlingException i ModelStreamErrorException w Bedrock poprzez diagnostykę limitów, implementację backoff i zwiększenie kwot.
Diagnoza i naprawa Terraform state drift: uzgodnienie ręcznych zmian, terraform import, refresh-only plan. Bezpieczny force-unlock stanu zablokowanego w DynamoDB.
Procedura audytu bezpieczeństwa środowiska AWS, od przeglądu IAM, przez konfigurację sieci, po szyfrowanie i monitoring. Gotowy checklist do cyklicznego stosowania.
Rozwiązanie problemu z GKE node pool zablokowanym w stanie PROVISIONING z powodu wyczerpania limitów, niewystarczających zakresów IP dla podów lub niedostępności wymaganego typu maszyny w skonfigurowanej strefie.
Wdrożenie Cloudflare Tunnel (cloudflared) jako Deployment w Kubernetes do udostępniania wewnętrznych serwisów ClusterIP bez otwierania portów. Działa identycznie na EKS, GKE, AKS i on-prem.
Diagnoza i naprawa błędów ALB 502 Bad Gateway spowodowanych awariami weryfikacji stanu target group - security groups, ścieżki, limity czasu i draining przy wdrożeniach.
Kompletny przewodnik migracji z przestarzałego aad-pod-identity na AKS Workload Identity Federation z użyciem OIDC issuer, managed identity i federated credentials.
Naprawa zablokowanego Terraform state lock, gdy terraform plan lub apply kończy się błędem Error acquiring the state lock po przerwanej operacji.
Naprawa tasków ECS Fargate, które się zatrzymują z Essential container exited, OutOfMemoryError lub CannotPullContainerError. Diagnostyka na podstawie metadanych i logów CloudWatch.
Naprawa błędu too many connections w RDS PostgreSQL: identyfikacja idle connections, zakończenie wyciekających sesji i wdrożenie connection pooling z RDS Proxy lub PgBouncer.
Naprawa 10 najczęstszych problemów wysokiego ryzyka (HRI) z AWS Well-Architected Review. Krok po kroku: IAM root access, szyfrowanie, backup, Multi-AZ, monitoring, logging - z komendami CLI i Terraform.
Naprawa 504 Timeout na API Gateway spowodowanego przez zimny start Lambda: diagnoza VPC ENI, optymalizacja pakietu, provisioned concurrency, SnapStart dla Java.
Szybka referencja mapowania usług kontenerowych AWS (ECS, Fargate, ECR, App Runner) na ich odpowiedniki Azure (Container Apps, ACI, ACR, Web App for Containers) z poradami kiedy co stosować.
Uruchomienie produkcyjnego stacku Supabase na czystym Docker Compose bez CLI. Pełna konfiguracja z własnymi rejestrami, zmiennymi środowiskowymi i siecią między serwisami.
Naprawa asymetrycznego routingu i hairpinningu ruchu przy wielu równoległych połączeniach AWS Site-to-Site VPN do GCP Cloud VPN.
Naprawa błędu 403 Forbidden z public.ecr.aws w supabase start przez zmianę rejestru obrazów na Docker Hub, GHCR lub własny prywatny rejestr.
Naprawa ThrottlingException 'too many tokens per day' w AWS Bedrock: analiza limitów dziennych, retry z exponential backoff, zwiększenie limitów, fallback na alternatywne modele.
Naprawa 502 Bad Gateway na ALB z Lambda target: przekroczenie limitu payload 1MB, timeout ALB 29s, malformed JSON response, Lambda cold start + ALB idle timeout.
Naprawa degradacji przepustowości AWS Site-to-Site VPN spowodowanej fragmentacją MTU na tunelach IPsec łączących się z GCP Cloud VPN.
Rozwiązywanie problemów sieciowych przy migracji z AWS Fargate do Azure Container Instances: DNS resolution, service discovery, NSG vs Security Groups, private endpoints.
Naprawa sesji BGP na GCP Cross-Cloud Interconnect oscylującej z powodu limitów ogłaszanych tras, konfliktów ASN lub niezgodności hold timer.
Diagnoza i naprawa tunelu AWS Site-to-Site VPN w stanie DOWN spowodowanego błędem negocjacji IKE Phase 1/2 przy połączeniu z GCP Cloud VPN.
Przywrócenie sesji BGP przez cross-connect Atman, gdy peering pada z powodu usterek warstwy fizycznej, problemów MTU lub wygaśnięcia hold timer.
Rozwiązanie konfliktów modułów PHP w cPanel EasyApache4, gdy zależności pakietów kolidują podczas przebudowy Apache, powodując błędy buildu lub uszkodzone instalacje PHP.
Odbudowa macierzy mdadm RAID na serwerze dedykowanym Hetzner po wymianie dysku: rescue mode, partycjonowanie i ponowne złożenie macierzy.
Przyspieszenie recovery Ceph w Proxmox, gdy OSD jest oznaczony out i backfill PG pełza mimo dostępnej przepustowości dysków.
Naprawa deadlocku operacji w ArgoCD, gdy stuck operation blokuje synchronizację z błędem another operation is already in progress.
Naprawa nieskończonej pętli OutOfSync w ArgoCD spowodowanej konfliktem między HPA a deklaratywnym zarządzaniem spec.replicas.
Diagnoza i naprawa błędu etcdserver: request is too large w ArgoCD, gdy Application CRD przekracza limit 1 MB w etcd.