Kubernetes v1.37 가르왈(Garhwal)
·
Kubernetes/Kubernetes 버전별 변경 이력
2026년 8월 26일, Kubernetes v1.37 가르왈(Garhwal)이 정식으로 출시되었다.가르왈은 히말라야 지역 이름이라고 한다. 이번 버전은 총 67개의 enhancement로 구성되며, 그중 Stable(GA) 16개, Beta 23개, Alpha 27개, deprecation/removal 1개가 포함됐다.대규모 클러스터의 제어 플레인 기능 강화 , AI/ML·고성능 워크로드를 위한 스케줄링과 리소스 관리 강화 업데이트가 주된 핵심 기능 동결과 Sneak Peek 글에서 미리 살펴본 항목 가운데 실제 릴리스에 확정된 내용을 중심으로, 운영자가 먼저 봐야 할 변화와 업그레이드 주의점을 정리한다.공식 사이트Kubernetes v1.37: Garhwal — Kubernetes Blog Kube..
KYAML 사용하기
·
Kubernetes/작은팁-짧은글
kubectl을 상용하면 필연적으로 yaml 포멧을 사용하게 된다. 물론 정확한 명세나 특정 리소스 구역을 픽스해서 추출 할 땐 json, jsonpath를 사용하지만 이는 숙련된 json 문법자가 아니라면 쉽지 않은게 사실이다. 가시성을 높여 보기 위해선 jq 로 한번 넘겨야하는것도 어찌 보면 제약 일 수 있다. 그렇다고 yaml 또한 완전하지는 않다. 리소스를 볼 때 너무 많은 정보가 나오기도 하고 들여쓰기 구조도 헷갈릴 수 있다. 이를 완화하기 위해 neat 같은 플러그인을 추가하기도 하지만 이 역시 플러그인이 추가로 붙는다는 단점이 있다. 그럼 이제 우리는 이걸 해소하기 위해 캬믈을 한번 써보자 발음을 모르겠어서 그냥 캬믈이라 했다.kubectl Version을 먼저 확인하세요kubectl get..
Kubernetes v1.37 Sneak Peek
·
Kubernetes/Kubernetes 버전별 변경 이력
Kubernetes v1.37 Sneak Peek은 v1.37 정식 릴리스 전 변경점 요약이다.원문 기준 정식 릴리스 예정일은 2026년 8월 26일이며, 최종 내용은 CHANGELOG에서 확정된다.변경점구분내용kubectl run--filename/-f deprecateStatic PodSecret/ConfigMap API 참조 금지kube-proxyipvs mode deprecate 시작kubeletcgroup v1 지원 종료 방향 유지StorageSELinuxMount GA 및 기본 활성화 예정Metricsmetrics.k8s.io API GA 예정Node securityKubelet in User Namespace Beta 예정CSIVolume Health Monitor Alpha 재도입 kube..
대기 작업 수로 Worker HPA를 해보자
·
Kubernetes
Kubernetes 블로그의 custom exporter 글은 worker_queue_depth를 예시로 든다. 큐에 쌓인 작업 수를 /metrics로 내보내고, Prometheus가 수집한 뒤 HPA가 그 값을 기준으로 Worker를 늘리는 그림이다. 이 예시는 CPU 사용률보다 "실제 처리해야 할 일이 얼마나 남았는가"가 더 중요한 시스템에서 특히 자연스럽다. 주문 후처리, 이미지 변환, 알림 발송, 정산 배치처럼 작업이 큐에 쌓이고 Worker가 이를 꺼내 처리하는 구조가 그렇다. 다만 exporter를 만들었다고 HPA가 곧바로 큐를 보고 Pod를 늘리는 것은 아니다. exporter는 값을 Prometheus 형식으로 바꿔 줄 뿐이고, HPA는 Prometheus Adapter를 통해 별도의 M..
conntrack가 만든 DNS 블랙홀 — Cisco ThousandEyes 장애 톺아보기
·
Kubernetes
이번 글의 원천은 Cisco ThousandEyes에서 공개한 실제 장애 사례다. 2025년 9월, "모든 것이 정상으로 보이는데 DNS만 안 되는" 상황이 발생했다. CoreDNS도 떠 있고, kube-proxy도 멀쩡하고, iptables 규칙도 제대로 복구되어 있는데 특정 클라이언트들의 DNS만 영원히 실패했다. 범인은 의외의 곳에 있었다. 파드도, kube-proxy도 아닌, 리눅스 커널의 연결 추적 장부(nf_conntrack)였다.이 글은 그 장애의 연쇄 과정과, 왜 복구된 iptables 규칙이 무시되었는지를 커널 내부 동작 순서로 정리한다. 쿠버네티스 네트워킹에서 가장 눈에 띄지 않지만 가장 자주 사람을 괴롭히는 컴포넌트가 conntrack이라는 점을, 이 사례만큼 잘 보여주는 케이스도 드..
DocumentDB / MongoDB의 FreeableMemory 함정
·
Kubernetes
운영하다 보면 한 번쯤 겪는 상황이 있다. DocumentDB(또는 MongoDB) 대시보드에서 FreeableMemory가 지속적으로 낮은 값을 가리키는 경우다. 이때 "메모리가 부족한 것 아닌가", "인스턴스를 확장해야 하는가"라는 판단으로 이어지기 쉽다. 그러나 결론부터 말하면, 해당 지표 하나만으로 메모리 부족 여부를 판단해서는 안 된다. DocumentDB/MongoDB 계열은 여유 메모리가 낮게 표시되더라도 그 메모리를 캐시로 정상적으로 사용 중인 경우가 많다. 이 글은 이른바 "FreeableMemory 함정"을 정리한다. 단독 판단이 왜 위험한지, 그리고 메모리 압박 여부를 정확히 판단하려면 어떤 지표를 함께 확인해야 하는지를 다룬다.AWS 공식 문서와 실제 운영 경험을 토대로 작성했다. ..
Kubernetes v1.37 기능 동결
·
Kubernetes/Kubernetes 버전별 변경 이력
이번에는 조금 다른 결의 글이다. 평소엔 정식 릴리스가 나오면 "하루(Haru)" 시리즈처럼 스테이블로 올라온 기능들을 정리했는데, 이번 v1.37은 아직 출시 전이다. 다만 지난 6월 16일자로 기능 동결(Enhancements Freeze)이 마무리되면서, 이번 릴리스에 어떤 기능들이 트래킹 보드에 올라탔는지가 확정되었다.즉, "8월에 무엇이 나올지" 미리 윤곽을 잡아볼 수 있는 시점이라는 뜻이다. 특히 AI/ML 배치 워크로드를 운영한다면, 7월 말 코드 동결(Code Freeze) 전에 미리 봐두면 좋을 KEP들이 꽤 보인다.공식 일정과 KEP 트래킹 보드를 기반으로 작성했으나, 명확하지 않은 부분은 경험을 토대로 보강했다.기능 동결 이후라도 코드 동결 전까지 일부 KEP는 단계(Alpha/Bet..
Kubernetes v1.36 하루(Haru) 업데이트 핵심
·
Kubernetes/Kubernetes 버전별 변경 이력
Kubernetes v1.36 하루 (Haru)들어가기 전많이 늦은 글입니다. 보통은 새로운 버전이 나오고 하루 내지 이틀 사이에는 포스팅을 하는데, 새로운 회사로 이직하고 적응기에 놓여있어 빠르게 글을 작성하지 못 했습니다. 아무쪼록 이번 쿠버네티스 하루는 재미있는 기능이 많이들 스테이블로 올라왔더군요, 다들 이번 이름처럼 좋은 하루 보내시길 바라겠습니다.Kubernetes v1.36 하루 (Haru)2026년 4월 22일 배포된 Kubernetes v1.36 "하루(Haru)"는 단순한 기능 추가를 넘어, 실제 운영 환경에서의 비효율을 제거하고 관리의 정밀도를 높이는 데 큰 방점을 두었다. 공식 릴리스 노트 중에서 "주요 업데이트 조명"과 "안정화된 기능" 섹션을 주된 내용으로 포스팅한다.이번 릴리스..
Kubernetes v1.36 업데이트 미리보기
·
Kubernetes
Kubernetes v1.36 릴리스가 2026년 4월 말로 다가오면서, 이번 사이클에서 어떤 기능이 빠지고 어떤 기능이 올라오는지 윤곽이 조금씩 드러나고 있다. 정식 릴리스 노트를 보기 전 단계라 확정된 내용으로 받아들이면 곤란하지만, 이번 v1.36 Sneak Peek를 보면 방향성은 꽤 분명하다. 보안상 부담이 큰 오래된 기능은 더 적극적으로 정리하고, SELinux·토큰 서명·DRA처럼 운영 난도가 높았던 영역은 한 단계 더 실용적으로 다듬는 흐름이다. 이번 포스팅에서는 공식 sneak peek 문서 기준으로, 운영자가 먼저 봐야 할 제거 예정 기능과 주요 개선 포인트만 추려 정리한다.이번 v1.36의 키워드는 "위험한 과거 기능 정리"와 "보안 및 장치 자원 관리 고도화" 두 가지로 보는 편이 ..
쿠버네티스는 왜 GPU를 잘 못 다룰까?
·
Kubernetes
쿠버네티스는 CPU와 메모리 중심 워크로드에는 꽤 자연스럽다.그런데 막상 AI 추론이나 학습 워크로드를 올려보면 생각보다 여기저기서 우회 계층이 필요하다. 겉으로는 Pod 스펙에 nvidia.com/gpu: 1 정도만 적으면 끝나보이지만, 실제로는 드라이버, 런타임 훅, 디바이스 플러그인, 벤더별 제약 위에 겨우 올라간 구조에 더 가깝다. 이번 포스팅에서는 왜 GPU가 쿠버네티스의 기본 자원 모델과 잘 안 맞는지, 그리고 그 빈틈을 메우기 위해 어떤 보완 계층들이 붙는지 정리한다.핵심은 단순하다. 쿠버네티스가 GPU를 전혀 못 쓰는 것은 아니다. 다만 GPU는 쿠버네티스가 원래 잘 다루도록 설계된 자원이 아니기 때문에, 제대로 쓰려면 생각보다 많은 보정이 필요하다. ( 공개 자료와 발표 내용을 기반으로 ..
웹 브라우저 Kubernetes 실습 환경 배포 플랫폼 개발기 - Playground Platform
·
Kubernetes
Github 주소https://github.com/ekdh600/kubernetes_playground 프로젝트는 AI 에이전트를 적극 활용하였습니다.숙련된 개발 경험이 많지 않아 설명이 명확하지 않을 수 있습니다.참조Kubernetes Python Client — GitHubxterm.js — 브라우저 터미널 라이브러리FastAPI — Python 비동기 웹 프레임워크 광고 클릭은 큰 힘이 됩니다! FastAPIFastAPI framework, high performance, easy to learn, fast to code, ready for productionfastapi.tiangolo.com Xterm.jsTerminal front-end component written in JavaScri..
Pause 컨테이너에 대한 나의 오해
·
Kubernetes/작은팁-짧은글
Pause 컨테이너이미 너무 잘 알려진대로 Pause 컨테이너는 파드가 생성될 때 가장 먼저 실행되어 기본 환경을 구성한다.그 외 네트워크 할당 격리등 다양한 동작을 하는데 오늘 다룰 내용은 위에서 잘 알려진 내용들이 아닌 프로세스 회수 절차에 대한 내용이다.공식 사이트광고 클릭은 큰 힘이 됩니다!(공식 사이트에서 발췌한 내용을 기반으로 작성하였으나,명확하지 않은 부분은 경험을 토대로 작성하였습니다.이는 정확한 정보가 아닐 수 있음을 알려드립니다.) 공식 문서는 아니지만 Pause에 대한 아주 좋은 글입니다. The Almighty Pause ContainerWhen checking out the nodes of your Kubernetes cluster, you may have noticed some ..
Kubestronaut 여정과 그 마지막
·
Kubernetes
Kubestronaut 취득Kubestronaut을 취득하였다. 특별하게 별 일 없으면 차주 월요일 중으로 홈페이지 등록과 뱃지가 전달 될 듯 하다. 상위 자격(?)인 Goldne Kubestronaut 프로그램이 존재하지만 13개의 오픈소스 자격증은 필요도 없거니와 이정도 자격증 비용을 감당해줄 회사가 별로 없다.. 또 갱신을 위해서는 거의 달마다 시험을 봐야할텐데 그만큼의 리소스를 할애할 여력도 없어 취득 할 생각이 없다. 지금까지의 여정과 작은 팁을 작성해본다.공식 사이트광고 클릭은 큰 힘이 됩니다! Kubestronaut ProgramRocket-power your Cloud Native skills The Kubestronaut program recognizes community leaders ..
GET 그리고 WATCH는 뭐가 다를까? - OpenTelemetry 장애 케이스
·
Kubernetes
서론쿠버네티스 API Server가 500 에러를 뱉으며 반복적으로 재시작되는 치명적인 장애가 발생했다.클라이언트의 호출 패턴(Watch)과 관측 도구(OTEL)의 설정 오류가 함께 발생학 복합적인 문제였다. 이번 포스팅에서는 GET과 WATCH의 차이를 이해하고 어떻게 클러스터 마비시켰는지 분석한다.(공식 사이트에서 발췌한 내용을 기반으로 작성하였으나,명확하지 않은 부분은 경험을 토대로 작성하였습니다.이는 정확한 정보가 아닐 수 있음을 알려드립니다.) 공식 사이트광고 클릭은 큰 힘이 됩니다! OpenTelemetryHigh-quality, ubiquitous, and portable telemetry to enable effective observabilityopentelemetry.io GET (Sn..
Disk Thin Provisioning 방식과 Node Deadlock 상관관계
·
Kubernetes
VMware나 Citrix와 같은 가상화 환경(Hypervisor) 위에서 쿠버네티스를 운영할 때, 디스크 할당 방식(Provisioning Type) 하나가 전체 노드를 마비시키는 치명적인 장애를 유발했다. 이번 포스팅은 디스크 I/O 지연이 어떻게 CPU 멈춤으로 이어지고, 결국 쿠버네티스 노드 장애를 일으키는지 정리한다.( 공식 사이트에서 발췌한 내용을 기반으로 작성하였으나, 명확하지 않은 부분은 경험을 토대로 작성하였습니다. 이는 정확한 정보가 아닐 수 있음을 알려드립니다. )공식 사이트광고 클릭은 큰 힘이 됩니다! NodesKubernetes runs your workload by placing containers into Pods to run on Nodes. A node may be a vi..
Kubernetes v1.35: 세계수 (The World Tree) 업데이트 핵심
·
Kubernetes/Kubernetes 버전별 변경 이력
Kubernetes v1.35 세계수2025년 12월 17일 배포된 Kubernetes v1.35 "Timbernetes"는 단순한 기능 추가를 넘어, 실제 운영 환경에서의 비효율을 제거하는 데 큰 방점을 두었다. 공식 릴리스 노트 중에서 "주요 업데이트 조명(Spotlight on Key Updates)"과 "안정화된 기능(Features Graduating to Stable)" 섹션을 주된 내용으로 포스팅한다.이번 릴리스의 하이라이트는 "중단 없는 운영"과 "네트워크 최적화", 그리고 "배치 작업의 유연성" 세 가지로 중점이다.운영자는 반드시 스테이징 환경에서 테스트 후 프로덕션에 적용해야 하며, 특히 알파/베타 기능 도입 시에는 세심한 주의가 필요함.( 공식 사이트에서 발췌한 내용을 기반으로 작성하..
React 보안 취약점 CVE-2025-55182 - React2Shell
·
Kubernetes/작은팁-짧은글
2025년 12월 3일, React의 치명적인 보안 취약점이 공개되었다. "React2Shell"로 불리는 이 취약점(CVE-2025-55182)은 CVSS 만점인 10.0을 기록할 정도로 위험도가 극도로 높다. React Server Components(RSC)를 사용하는 환경에서 인증 없이 원격 코드 실행(RCE)이 가능하다는 점에서, Next.js 등을 사용하는 운영자들의 즉각적인 대응이 요구된다. 본 글에서는 12월 12일 기준 확인된 취약점의 상세 내용과, 어제(11일) 추가로 발견된 연관 취약점까지 포함하여 대응 방안을 정리한다.(공식 사이트에서 발췌한 내용을 기반으로 작성하였으나, 명확하지 않은 부분은 경험을 토대로 작성하였습니다. 이는 정확한 정보가 아닐 수 있음을 알려드립니다.)참고 링크..
I/O 병목과 ETCD 그리고 API 서버
·
Kubernetes
운영 중이던 쿠버네티스 클러스터에서 특정 노드가 갑자기 NotReady 상태로 전환되는 장애가 발생했다.일반적으로 노드 장애는 kubelet 다운이나 자원 고갈을 의심하기 마련이다. 하지만 이번 케이스는 로그 분석 결과, 노드가 아닌 etcd의 성능 저하가 나비효과를 일으켜 발생한 사건이었다. 이 글에서는 etcd 지연 → apiserver 응답 불가 → kubelet 갱신 실패로 이어지는 장애의 인과관계를 실제 로그 패턴과 함께 살펴본다. 이전 글인 "Kubernetes Node Life Cycle - 노드의 생명주기" 밀접한 글이므로 이전 글을 확인하고 오시면 더 좋습니다. Kubernetes Node Life Cycle - 노드의 생명주기쿠버네티스에서 노드 헬스 체크(Node Health Chec..
Ingress NGINX의 공식 은퇴
·
Kubernetes
서두Kubernetes SIG Network와 Security Response Committee(SRC)는 2025년 11월, Kubernetes 생태계에서 가장 널리 사용되어 온 Ingress 컨트롤러인 Ingress NGINX의 공식 은퇴(retirement)를 발표했다.마지막 유지보수는 2026년 3월까지만 최종 유지보수(best-effort maintenance)가 지속되며, 이후에는 보안 패치·버그 수정·기능 업데이트가 단 한 건도 제공되지 않는다.아래도 나오지만, 빚처럼 쌓여있는 유지보수 문제를 두 명 남짓한 개발자로 감당하기에는 더 이상 역부족인듯 하다.클라우드 생태계의 변화야 늘 있던것이지만 그걸 맞춰 따라가려면 그만한 개발 인력이 필요한데 ingress nginx에 인력을 투입하기엔 이미..
Kubernetes v1.35 업데이트 미리보기
·
Kubernetes/Kubernetes 버전별 변경 이력
서두Kubernetes v1.35 릴리스가 다가오면서 프로젝트는 안정성과 보안, 기능 일관성을 위해 여러 기능을 정리하고 새 기능을 도입한다. v1.35에서 예정된 중요한 폐기(deprecation), 제거(removal), 신규/향상 기능을 미리 살펴본다.공식 사이트 Kubernetes v1.35 Sneak PeekAs the release of Kubernetes v1.35 approaches, the Kubernetes project continues to evolve. Features may be deprecated, removed, or replaced to improve the project's overall health. This blog post outlines planned changes..
Kubernetes Node Life Cycle - 노드의 생명주기
·
Kubernetes
쿠버네티스에서 노드 헬스 체크(Node Health Check)는 클러스터의 안정적인 운영을 보장하는 메커니즘이다.이 글에서는 두 가지 개념을 톺아본다.노드 헬스 체크의 전반적인 구조와 개념실제로 어떤 플로우와 시간 단위로 동작하는지(공식 사이트에서 발췌한 내용을 기반으로 작성하였으나, 명확하지 않은 부분은 경험을 토대로 작성하였습니다. 이는 정확한 정보가 아닐 수 있음을 알려드립니다.)공식 사이트광고 클릭은 큰 힘이 됩니다! NodesKubernetes runs your workload by placing containers into Pods to run on Nodes. A node may be a virtual or physical machine, depending on the cluster. E..
Kubernetes Calico CNI와 스케줄링 실패 관계
·
Kubernetes
Kubernetes Calico CNI: 극심한 파드 지연 혹은 스케줄링 실패운영 중 약 1년간 유휴 노드 상태로 대기중인 노드의 cordon 상태를 uncordon 상태로 변경한 뒤POD 스케줄링 실패 및 calico-node pod crashloopbackoff 현상 발생등 비정상 동작을 야기했다. calico-node pod 로그와 CERN 포럼에 올라온 디버깅 무선를 참고해 왜 이런현상이 발생했는지에 대한 분석을 작성한다. (명확하지 않은 부분은 경험을 토대로 작성하였습니다. 이는 정확한 정보가 아닐 수 있음을 알려드립니다.)참고자료CERN calico 디버깅 PDF 파드 생성이 느려지거나, 무한 대기하는 경우유휴 기간이 긴 노드를 스케줄링 상태로 변경하거나, 짧은 순간에 폭발적인 배포 상태를 ..
MinIO 공식 Docker 이미지 배포 중단 사태
·
Kubernetes
오브젝트 스토리지 솔루션 MinIO가 2025년 10월 중순의 보안 업데이트 릴리스부터 커뮤니티 에디션의 공식 Docker 이미지 배포를 중단했다. 이 정책 변경은 해당 버전부터 더 이상 DockerHub나 Quay 등의 공식 이미지가 업데이트되지 않음을 의미하며, MinIO 팀은 사용자들에게 "이제 소스 코드만 배포하며, 컨테이너 이미지를 사용하려면 직접 빌드해야 한다"고 답변했다. 개인적인 입장에서 오픈소스의 수익화 문제는 다같이 심히 고려해볼 사항이 맞다고 생각한다. 아무리 좋은 OSS를 개발/배포를 하더라도 수익화에 실패하면 열정페이와 달라지는게 없다고 생각하기에, 하지만 이번 MinIO 사태는 사전공지 없이 너무도 빠른 시간내 정책이 변경 된 사항이라 비판의 소지는 충분해보인다.깃헙 Docker..
Kubernetes v1.34: 바람과 의지 (Of Wind & Will) 업데이트 핵심
·
Kubernetes/Kubernetes 버전별 변경 이력
Kubernetes v1.34 바람과 의지 (Of Wind & Will)Kubernetes v1.34, 코드명 "Of Wind & Will" (O' WaW)은 2025년 8월 27일 수요일에 발표됐다. 이번 릴리스는 총 58개의 개선 사항으로 구성됐다. 이 중 23개는 안정화(Stable) 단계, 22개는 베타(Beta) 단계, 13개는 알파(Alpha) 단계로 진입했다. 공식 사이트광고 클릭은 큰 힘이 됩니다! Kubernetes v1.34: Of Wind & Will (O' WaW)Editors: Agustina Barbetta, Alejandro Josue Leon Bellido, Graziano Casto, Melony Qin, Dipesh Rawat Similar to previous re..
Kubernetes 1.33 “Octarine” 업데이트 핵심
·
Kubernetes/Kubernetes 버전별 변경 이력
Kubernetes 1.33 OctarineKubernetes v1.33, 코드명 “Octarine”은 2025년 4월 출시된 이번 버전에는 안정성, 보안, 사용성을 강화하는 64개의 개선 사항이 포함됐다. 이 중 18개는 GA, 20개는 베타, 24개는 알파 단계에 도달했고 일부 기능은 더 이상 사용되지 않는다. 본 글에서는 중급 및 고급 사용자가 주목할 만한 다섯 가지 핵심 업데이트를 정리한다. 추가로 이 글은 kodecloud 유튜브를 참고하여 작성했다. 굉장히 좋은 영상이므로 시청후 글 작성을 마음 먹었다.(자동 번역 자막 외에는 제공되는 한국어가 제대로 없기에 이 글을 작성한다.) kodecloud kubernetes 1.33(공식 사이트에서 발췌한 내용을 기반으로 작성하였으나, 명확하지 않은 ..
Kubernetes Internal Network 변경 절차
·
Kubernetes
서두운영 중인 네트워크 대역을 변경하는 일은 매우 높은 위험을 동반하기에 권장하지 않으며, 공식 문서 또한 노드 정보 변경 시 재등록을 권장합니다.노드 이름 고유성 섹션에서 언급했듯이, 노드 구성을 업데이트해야 하는 경우 API 서버에 노드를 다시 등록하는 것이 좋다. 예를 들어 kubelet이 --node-labels 의 새로운 구성으로 다시 시작되더라도, 동일한 노드 이름이 사용된 경우 레이블이 해당 노드의 등록에 설정되기 때문에 변경 사항이 적용되지 않는다. (공식 문서 발췌) ( 공식 사이트에서 발췌한 내용을 기반으로 작성하였으나, 일부는 경험을 토대로 정리했습니다. 정확하지 않을 수 있음을 알려드립니다. )공식 사이트광고 클릭은 큰 힘이 됩니다! 노드쿠버네티스는 컨테이너를 파드내에 배치하고 노..
[Calico] calico-node Routing 경로 불일치로 인한 pod to pod 통신 실패
·
Kubernetes
서두Kubernetes 클러스터 운영중 Calico CNI를 사용하는 경우, 노드에 여러 NIC가 존재할 때 특정 (대규모 재앙급 장애) 상황에서 라우팅 인터페이스가 예상과 다르게 설정되어 pod to pod 통신 불가로 인한 Service Discovery, DNS, API 서버와의 통신까지 실패하는 상황이 발생했다. 이번 글에서는 실제 운영 환경에서 발생한 라우팅 경로 인터페이스 불일치로 인한 복합 장애 사례와 그 해결 방법을 정리한다. ( 공식 사이트에서 발췌한 내용을 기반으로 작성하였으나, 명확하지 않은 부분은 경험을 토대로 작성하였습니다. 이는 정확한 정보가 아닐 수 있음을 알려드립니다.)공식 사이트광고 클릭은 큰 힘이 됩니다! Configure IP autodetection | Calico ..
Istio Mesh Network 그리고 Timeout
·
Kubernetes
현상Istio Mesh Network를 통해 멀티 클러스터 환경에서 노드 재기동 절차중 발생한 어플리케이션 호출 응답 에러 발생분명 Pod는 정상적으로 살아 있고 클러스터 내부 네트워킹에는 전혀 문제가 없어보였다. 윗 단 네트워크부터 몇달간 보이지 않는 로그를 긁어가며 드디어 원인을 밝히게 되었다. ( 공식 사이트에서 발췌한 내용을 기반으로 작성하였으나, 명확하지 않은 부분은 경험을 토대로 작성하였습니다.이는 정확한 정보가 아닐 수 있음을 알려드립니다. )공식 사이트https://istio.io/latest/docs/reference/config/istio.mesh.v1alpha1/#MeshNetworks Global Mesh OptionsConfiguration affecting the service ..
Kubernetes Node Name - 불변(Immutable)
·
Kubernetes
Kubernetes Node Name - 불변(Immutable)Kubernetes에서 Node는 클러스터의 리소스를 제공하는 단위이며 각 노드는 고유한 이름으로 식별된다. 이 이름은 단순한 레이블이 아니라 API 서버에서 Node 객체를 참조하고 스케줄링 및 상태 관리를 수행하는 핵심 식별자다. 본 글에서는 Kubernetes에서 왜 Node 이름이 불변인지 그 배경과 실제 운영 환경에서의 고려사항을 정리한다. 공식 문서 NodesKubernetes runs your workload by placing containers into Pods to run on Nodes. A node may be a virtual or physical machine, depending on the cluster. Each..
Statefulset - 장애 케이스
·
Kubernetes/작은팁-짧은글
Statefulset스테이트풀셋은 애플리케이션의 스테이트풀을 관리하는데 사용하는 워크로드 API 오브젝트이다.파드 집합의 디플로이먼트와 스케일링을 관리하며, 파드들의 순서 및 고유성을 보장한다. 디플로이먼트와 유사하게, 스테이트풀셋은 동일한 컨테이너 스펙을 기반으로 둔 파드들을 관리한다. 디플로이먼트와는 다르게, 스테이트풀셋은 각 파드의 독자성을 유지한다. 이 파드들은 동일한 스팩으로 생성되었지만, 서로 교체는 불가능하다. 다시 말해, 각각은 재스케줄링 간에도 지속적으로 유지되는 식별자를 가진다. 스토리지 볼륨을 사용해서 워크로드에 지속성을 제공하려는 경우, 솔루션의 일부로 스테이트풀셋을 사용할 수 있다. 스테이트풀셋의 개별 파드는 장애에 취약하지만, 퍼시스턴트 파드 식별자는 기존 볼륨을 실패한 볼륨을 ..