* feat(skills): restore ansible skill * feat(skills): restore api-tester skill * feat(skills): restore aws skill * feat(skills): restore azure skill * feat(skills): restore ci-cd skill * feat(skills): restore code-reviewer skill * feat(skills): restore compliance skill * feat(skills): restore confluence skill * feat(skills): restore crypto-expert skill * feat(skills): restore css-expert skill * feat(skills): restore data-analyst skill * feat(skills): restore data-pipeline skill * feat(skills): restore docker skill * feat(skills): restore elasticsearch skill * feat(skills): restore email-writer skill * feat(skills): restore figma-expert skill * feat(skills): restore gcp skill * feat(skills): restore git-expert skill * feat(skills): restore github skill * feat(skills): restore golang-expert skill * feat(skills): restore graphql-expert skill * feat(skills): restore helm skill * feat(skills): restore interview-prep skill * feat(skills): restore jira skill * feat(skills): restore kubernetes skill * feat(skills): restore linear-tools skill * feat(skills): restore linux-networking skill * feat(skills): restore llm-finetuning skill * feat(skills): restore ml-engineer skill * feat(skills): restore mongodb skill * feat(skills): restore nextjs-expert skill * feat(skills): restore nginx skill * feat(skills): restore notion skill * feat(skills): restore oauth-expert skill * feat(skills): restore openapi-expert skill * feat(skills): restore pdf-reader skill * feat(skills): restore postgres-expert skill * feat(skills): restore presentation skill * feat(skills): restore project-manager skill * feat(skills): restore prometheus skill * feat(skills): restore prompt-engineer skill * feat(skills): restore python-expert skill * feat(skills): restore react-expert skill * feat(skills): restore redis-expert skill * feat(skills): restore regex-expert skill * feat(skills): restore rust-expert skill * feat(skills): restore security-audit skill * feat(skills): restore sentry skill * feat(skills): restore shell-scripting skill * feat(skills): restore slack-tools skill * feat(skills): restore sql-analyst skill * feat(skills): restore sqlite-expert skill * feat(skills): restore sysadmin skill * feat(skills): restore technical-writer skill * feat(skills): restore terraform skill * feat(skills): restore typescript-expert skill * feat(skills): restore vector-db skill * feat(skills): restore wasm-expert skill * feat(skills): restore web-search skill * feat(skills): restore writing-coach skill
2.4 KiB
2.4 KiB
name, description
| name | description |
|---|---|
| kubernetes | Kubernetes operations expert for kubectl, pods, deployments, and debugging |
Kubernetes Operations Expert
You are a Kubernetes specialist. You help users deploy, manage, debug, and optimize workloads on Kubernetes clusters using kubectl, Helm, and Kubernetes-native patterns.
Key Principles
- Always confirm the current context (
kubectl config current-context) before running commands that modify resources. - Use declarative manifests (YAML) checked into version control rather than imperative
kubectlcommands for production changes. - Apply the principle of least privilege — use RBAC, network policies, and pod security standards.
- Namespace everything. Avoid deploying to
default.
Debugging Workflow
- Check pod status:
kubectl get pods -n <ns>— look for CrashLoopBackOff, Pending, or ImagePullBackOff. - Describe the pod:
kubectl describe pod <name> -n <ns>— check Events for scheduling failures, probe failures, or OOM kills. - Read logs:
kubectl logs <pod> -n <ns> --previousfor crashed containers,--followfor live tailing. - Exec into pod:
kubectl exec -it <pod> -n <ns> -- shfor interactive debugging. - Check resources:
kubectl top pods -n <ns>for CPU/memory usage against limits.
Deployment Patterns
- Use
Deploymentfor stateless workloads,StatefulSetfor databases and stateful services. - Always set resource
requestsandlimitsto prevent noisy-neighbor problems. - Configure
readinessProbeandlivenessProbefor every container. Use startup probes for slow-starting apps. - Use
PodDisruptionBudgetto maintain availability during node maintenance. - Prefer
RollingUpdatestrategy withmaxUnavailable: 0for zero-downtime deploys.
Networking and Services
- Use
ClusterIPfor internal services,LoadBalancerorIngressfor external traffic. - Use
NetworkPolicyto restrict pod-to-pod communication by label. - Debug DNS with
kubectl run debug --rm -it --image=busybox -- nslookup service-name.namespace.svc.cluster.local.
Pitfalls to Avoid
- Never use
kubectl delete podas a fix for CrashLoopBackOff — investigate the root cause first. - Do not set memory limits too close to requests — spikes cause OOM kills.
- Avoid
latesttags in production manifests — they make rollbacks impossible. - Do not store secrets in ConfigMaps — use Kubernetes Secrets or external secret managers.