Cloudturing knowledge hub

Blog

문서 기반 AI 챗봇, 업무 자동화, 운영 데이터 활용에 대한 Cloudturing의 실무 콘텐츠를 정리합니다.

GKE와 Cloud Run 이미지를 Artifact Registry에서 분리한 이유

2026. 08. 25 11:41

GKE와 Cloud Run 이미지를 Artifact Registry에서 분리한 이유

컨테이너 저장소를 배포 런타임과 환경별로 나눠 IAM, 탐색, rollback과 cleanup 정책의 영향 범위를 줄인 과정입니다.

사용 중인 컨테이너 이미지를 지우지 않는 Docker 정리 전략

2026. 08. 24 15:41

사용 중인 컨테이너 이미지를 지우지 않는 Docker 정리 전략

Artifact Registry 정리 전에 Kubernetes workload가 참조하는 tag와 digest를 보호하고, 조회 실패 시 삭제를 중단하는 fail-closed 운영 패턴을 설명합니다.

GKE Audit Log를 현재 상태로 투영하는 이벤트 시스템

2026. 08. 24 15:41

GKE Audit Log를 현재 상태로 투영하는 이벤트 시스템

Pod·Node lifecycle Audit Log를 UID와 발생 시각 기준으로 reduce해 중복, 순서 역전과 이름 재사용을 견디는 현재 상태를 만드는 방법입니다.

Spot 선점 이벤트를 장애 에피소드로 묶어 알림하기

2026. 08. 24 15:41

Spot 선점 이벤트를 장애 에피소드로 묶어 알림하기

개별 Spot 선점과 Pod 영향을 시간 구간 episode로 상관 분석하고 Slack 메시지 한 건을 계속 갱신해 알림 소음을 줄인 운영 패턴입니다.

Pod가 안 늘어난 진짜 이유: GKE 보조 IP 대역 고갈

2026. 08. 24 14:49

Pod가 안 늘어난 진짜 이유: GKE 보조 IP 대역 고갈

CPU나 quota가 아닌 VPC-native GKE의 Pod secondary range 고갈로 scale-up이 실패한 사례와 진단 순서, 장기 CIDR 계획을 설명합니다.

고가용성을 단순화했다: Valkey Sentinel을 제거한 이유

2026. 08. 24 14:49

고가용성을 단순화했다: Valkey Sentinel을 제거한 이유

Spot 선점 뒤 Sentinel의 primary 인식과 replication이 갈라진 경험을 바탕으로, 단일 Standard Valkey를 선택한 조건과 포기한 것을 정리합니다.

개발 서버에서 PM2 reload가 Pod를 죽였다: 순간 메모리와 OOMKilled

2026. 08. 24 14:49

개발 서버에서 PM2 reload가 Pod를 죽였다: 순간 메모리와 OOMKilled

개발 서버에서 빠른 확인을 위해 PM2 reload를 실행하자 구·신 Node.js 프로세스의 메모리가 겹쳐 OOMKilled가 발생한 사례입니다. 운영은 이미지 재배포 방식으로 이 경로를 사용하지 않습니다.

GKE Autopilot에서 Spot과 일반 Pod를 함께 운영한 이유

2026. 08. 24 14:49

GKE Autopilot에서 Spot과 일반 Pod를 함께 운영한 이유

일반 Pod 하나와 Spot Pod 하나를 같은 Service·NEG에 연결해 안정적인 최소 용량과 비용 효율을 함께 확보한 선택과 운영 조건을 정리합니다.