클러스터
노드 상태, 자원 분포, 사용량 추이, 외부 모니터링, 스토리지 현황을 한 화면에서 살펴봅니다.
관리자 메뉴 → 클러스터 로 들어갑니다. 한 페이지 안에 다섯 개 탭이 들어 있습니다.
페이지 구성
위쪽의 마지막 업데이트 / 자동 새로고침 / 새로고침 컨트롤은 모든 탭에 공통으로 적용됩니다.
상태 탭
요약 카드
노드 목록
요약 카드 아래에 Ready 노드 와 Drained 노드 가 나뉘어 보입니다.
보기 방식 — 그리드 / 리스트
가속기 필터
노드 상세
카드 또는 줄을 누르면 상세 창이 열립니다.
노드 정보
실행 중인 Pod 목록: 그 노드에서 동작 중인 Pod 목록이 같이 보입니다.
노드 진단
정상이면 초록색, 문제가 있으면 경고로 표시됩니다.
진단에 빨간불이 켜졌다면
새 Pod 배치가 막히거나 동작 중인 Pod가 흔들릴 수 있습니다. 즉시 원인을 살펴 조치합니다.
작업 배치 제외 (Drain)
상세 창 아래쪽 스케줄러 제외 버튼을 누르면 그 노드는 새 작업을 잠시 받지 않게 됩니다.
- 이미 동작 중인 Pod는 그대로 살아 있습니다.
- 하드웨어 점검, 드라이버 업데이트, 노드 정기 점검 때 씁니다.
분포 탭
가속기가 어디에 어떻게 쓰이고 있는지 시각화해서 보여 줍니다.
그룹별 색깔 범례로 어느 팀이 어느 GPU를 쓰고 있는지 빠르게 봅니다.
사용량 탭
클러스터 전체 자원이 얼마나 차 있는지 카드와 막대로 보여 줍니다.
각 카드에 사용량 / 한도 / 총량 과 사용률 막대가 함께 있습니다.
모니터링 탭
시간에 따른 사용량 추이는 Grafana로 봅니다. 모니터링 탭을 누르면 새 탭에서 Grafana가 열립니다.
Grafana는 Cluma와 별도로 클러스터 안 monitoring 작업 공간에 떠 있어야 하고, Cluma 관리자가 그 주소를 환경변수로 설정해 둔 경우에만 열립니다.
note 탭을 눌러도 아무것도 안 열린다면
Grafana 주소가 비어 있는 상태입니다. 클러스터 배포 담당자에게 사용자 화면 빌드의 NEXT_PUBLIC_GRAFANA_URL 환경변수 설정을 요청하세요.
Grafana에서 보이는 것
Grafana 접속 정보
note 사내 도메인을 쓴다면
grafana.internal 같은 사내 도메인을 쓰는 경우, 작업 PC의 /etc/hosts 에 노드 IP 매핑을 추가합니다.
<노드 IP> grafana.internal
스토리지 탭
클러스터에 등록된 저장소 유형별로 용량과 사용량을 봅니다.