관련: 2026 HPC GPU 운영계획 | 2026 HPC 지원사업 - 시민재생에너지 사업자동화 AI


KT Cloud AI Nexus 플랫폼 공식 매뉴얼 요약 (출처: NIPA·KT Cloud·Lablup 저작물 — 전문 전사 금지, 원문 링크 아래).

우리 상황 기준: 사교원 exaone-train 프로젝트 / H200 1장 / Interactive 세션 / 7개월(~12월)

2026-08-12 개정판 반영

㈜콘텐츠브릿지(kt cloud 운영관리)가 8/11 배포한 8/10 수정본 5종 + 사용자 교육 녹화본 2편을 반영했다. 6월판 대비 달라진 것:

구분내용
🔴 신설월간 GPU 사용시간·가동률 산정 공식이 매뉴얼에 명문화됨 (아래 첫 절). 사용률 85% 의무와 직결
🔴 정정NAS 실수 삭제 → 6월판 정리는 “복구 불가”였으나 snapshot으로 복구 가능이 맞다
🔴 정정NFS filelock 우회 → “캐시 경로를 NAS 외부로”가 아니라 huggingface_hub 코드를 SoftFileLock으로 수정이 원문 안내다
추가필수 서비스 종료 주의(pkill 금지), 예약 포트 목록, 세션 상태 전이, 보정 프로세스 주기, 커스텀 이미지 UID 1100 이슈, NCCL 환경변수, 멀티노드 Infiniband 구성
분량1번 가이드 52p → 56p
🔴 신규교육 녹화본 2편(총 2시간 22분)을 넥서스 H200으로 전사해 반영(6번 절). PDF에 없는 운영 기준·정책 발언이 다수 — 특히 회수 위험 3단계의 실제 수치와 지원 범위 해석

0. 🔴 GPU 사용시간·가동률 산정 기준 (8/10 신설)

사용률이 평가 지표인 우리에게 가장 중요한 신규 절이다. 2026 HPC GPU 운영계획의 월 85% 목표가 어떻게 계산되는지가 여기 나온다.

항목기준
월간 GPU 사용시간nvidia-smiGPU Util이 0을 초과한 시간. 사용자별로 1분 단위 수집
월간 GPU 가동률GPU 사용시간 ÷ (자원 제공일수 × 24시간)
자원 회수 판정세션 기준 최근 6시간 평균 GPU Util < 1%

🔴 가동률과 회수 판정의 분모가 다르다. 가동률은 Util > 0인 시간만 세지만, 회수 기준 평균값은 Util 0 구간을 포함해 산출한다. 즉 “가끔 짧게 돌리는” 패턴은 가동률도 못 채우고 회수 위험도 높다.

회수 예외·안전장치:

  • 최근 6시간 평균 CPU Util이 1% 이상이면 GPU 기준에 걸려도 회수 대상에서 제외된다.
  • 세션 목록에서 자기 세션의 회수 위험을 안전 / 경고 / 위험 3단계로 볼 수 있다.
  • 세션 생성 후 최초 6시간은 판단 최소 시간이라 삭제되지 않는다.

우리 실천 수칙: 학습 잡이 끝나면 다음 실험(하이퍼파라미터 탐색·평가·증강)을 이어 큐에 올려 GPU Util을 끊지 않는다. 유휴가 불가피하면 최소한 CPU 작업(전처리·토크나이즈)이라도 돌려 CPU Util 1% 선을 지킨다.


1. AI Nexus 사용자 가이드 GUI (56p, v1.0 260810 수정)

원문: 구글 드라이브

이 문서가 다루는 범위: AI Nexus 웹UI 전체 기능 — 대시보드·계정 설정·데이터 폴더·세션 생성·이미지 커밋·기술지원 연결까지.

서비스 구조 핵심

  • 컨테이너(Docker) 기반 — VM·베어메탈 아님. Docker-in-Docker·Kubernetes·Slurm 불가.
  • 세션 내 앱(JupyterLab, VSCode 등)은 하위도메인 Proxy를 통해 접근(https://<앱><uuid>.ainexus.ktcloud.com 형태). 별도 포트 포워딩 불필요.
  • 추가 포트 필요 시 세션 시작 전 Preopen Ports 설정(1025–65535 범위).
  • 앱을 외부에 공개해도 세션에 직접 접근은 불가하고 반드시 Proxy를 경유한다.
  • 외부 SSH 접속: 세션 앱 다이얼로그 → SSH/SFTP 아이콘 클릭 후 접속 정보·키 확인 → 하위도메인 기반 주소로 접속.

계정 보안 설정

  • 2FA(이중 인증) 활성화 가능 — Google OTP 등 사용.
  • 허용된 클라이언트 IP 설정으로 특정 IP 대역에서만 로그인 허용 가능. ⚠️ 잘못 입력하면 본인도 접근 불가.

자원 회수 규칙 (핵심)

항목기준
회수 조건최근 6시간 GPU Cuda Util 평균 1% 미만
예외순간 0% 구간이 있어도 6시간 평균 1% 이상이면 유지 / CPU Util 1% 이상이면 제외
세션당 최대 컨테이너2개
최대 동시 세션5개 (사용자 1인 기준)
데이터 폴더최대 10개
커밋 이미지최대 3개
로그인 타임아웃기본 8시간 (새로고침으로 연장)

데이터 폴더 (NAS) — 영속 스토리지

  • 세션의 기본 파일시스템(/home/work 로컬 디스크, Scratch)은 세션 삭제 시 사라짐.
  • 모든 체크포인트·데이터·코드는 데이터 폴더(vFolder/NAS)에 저장해야 유지됨.
  • 세션 생성 시 폴더를 마운트하면 /home/work/폴더명에 접근. Alias를 주면 /model처럼 다른 경로로 마운트 가능(시스템 경로와 겹치지 않게).
  • 🔴 세션 생성 이후에는 폴더 마운트가 불가능하다. 반드시 생성 시점에 마운트할 것.
  • 자동 마운트 폴더: 이름이 .(점)으로 시작하는 폴더는 세션 생성 시 자동 마운트됨 → .local 폴더로 pip 사용자 설치 패키지를 영속화하는 방식 활용 가능.
  • 파일 업로드 방법: 드래그앤드롭(4GB 미만), 파일 브라우저(웹앱), SFTP 서버(대용량).
  • ⚠️ 파일 브라우저·SFTP 서버도 세션을 하나 소모한다. 자원·세션 수 여유가 없으면 실행되지 않는다.
  • NAS 80% 이상 사용 시 1TB 무상 추가 가능(6월 안내 기준). 쿼터 부족 시 기술지원 게시판으로 증설 요청.
  • 폴더 삭제는 휴지통 이동 → 영구 삭제 2단계. 휴지통에서 복구 가능.

컨테이너 커밋 (환경 저장)

저장되는 데이터저장 안 되는 데이터
sudo pip install / sudo apt install한 패키지/home/work (Scratch), 일반 폴더, 자동 마운트 폴더
/home/work 외 특정 디렉토리사용자 레벨 pip install (단, .local을 자동마운트 폴더로 설정하면 재사용 가능)
설정 파일·소스코드별도 mount한 NAS 폴더의 실제 데이터
  • 💡 PyPI 패키지를 새 이미지에 포함하려면 반드시 sudo pip install.
  • 커밋 이미지 최대 3개. 초과 시 기존 삭제 후 커밋. 커밋 이미지는 본인에게만 보인다.
  • 커밋 이미지로 세션 만드는 법: 좌측 “나의 실행 환경” → 해당 이미지의 경로 복사 → 세션 생성 시 “환경 이름(수동)“에 붙여넣기. (bai user 태그로 식별)

🔴 필수 서비스 종료 주의 (8/10 신설)

세션 컨테이너 안에는 사용자 작업 외에 시스템 필수 서비스가 함께 돈다. 이름 기반 일괄 종료(pkill, killall)는 이것들까지 죽인다.

명령결과
pkill -f pythonJupyter, SFTP 등 python 기반 서비스 동반 종료
pkill -f bai-krunner세션 제어 서비스 종료 → 해당 세션 사용 불가
pkill -f dropbearSSH·SFTP 접속 끊김

자기가 띄운 프로세스 외에는 종료 명령을 쓰지 말 것. 실수로 죽였으면 기술지원 게시판으로 조치 요청.

GPU·CUDA 호환성

GPU아키텍처Compute Capability최소 CUDA권장 CUDA
H200Hopper9.0 (sm_90)11.812.4 이상
H100Hopper9.0 (sm_90)11.812.x
A100Ampere8.0 (sm_80)11.011.8 이상
  • 제공 NVIDIA Driver: 580.126.20 (PB 라인). 사용자별 Driver 변경은 지원하지 않는다.
  • 제공 이미지: NGC PyTorch(CUDA 12.6 / 12.8 / 13.0), vLLM, Rebellions Ubuntu 계열.
  • A100 기반 코드를 H200으로 이전 시 CUDA Extension·Custom Kernel·NCCL·PyTorch Binary·서드파티 라이브러리에서 호환성 이슈 발생 가능 → CUDA 12 이상 + 최신 PyTorch로 재빌드 권장.
  • 커스텀 이미지 필요 시: Docker Hub에 push 후 기술지원 게시판에 이미지 URL 문의 → AI Nexus 전용 Harbor에 등록(매주 취합 후 제공).

사업 종료 시 데이터 백업

  • 사업 종료 후 모든 자원 회수됨. SFTP 서버를 이용해 로컬 백업 권장.
  • SFTP 세션도 세션 개수·자원 소모 → 여유 확인 후 실행.

2. GPU 사용자 Workflow (15p)

원문: 구글 드라이브

이 문서가 다루는 범위: NIPA HPC 사업 기준 GPU 학습 4단계 워크플로우 — 데이터 업로드 → 환경 구성 → 학습 수행 → 백업.

H200 스펙 참고 (문서 실측값)

항목H200 SXMH100 SXMA100 SXM
GPU 메모리HBM3e 141GBHBM3 80GBHBM2e 80GB
메모리 대역폭4.8 TB/s3.35 TB/s2.04 TB/s
FP16/BF16 Tensor1,979 TFLOPS1,979 TFLOPS624 TFLOPS
FP8 Tensor3,958 TFLOPS3,958 TFLOPS미지원
NVLink 대역폭900 GB/s900 GB/s600 GB/s
최대 소비전력700W700W400W

지원하지 않는 것 (명문화)

  • Docker-in-Docker — 이미 컨테이너 내부라 권한·네트워크·보안 이슈.
  • NVIDIA Driver 커스텀 버전 — 호스트 노드 단위 PB 라인 운영.
  • Kubernetes / Slurm 클러스터 구축 — 대신 커스텀 이미지·멀티노드·Batch 세션·FastTrack으로 분산학습·잡 스케줄링을 대체 제공.
  • Host Level 권한 — root, 커널 모듈, PCI Device 직접 제어, OS 재설치, systemd 서비스 구성.

워크플로우 4단계

STEP 1. 데이터 및 모델 업로드

  • NAS 데이터 폴더에 SFTP 또는 파일 브라우저로 학습 데이터·베이스 모델 업로드.
  • 대용량 파일은 SFTP 방식 사용.

STEP 2. GPU 개발 환경 구성

  • 기본 NGC 이미지 선택(PyTorch + CUDA 사전 검증됨) → 즉시 사용 가능. OS는 Ubuntu 24.04 LTS 등 (Windows 미제공).
  • TensorFlow 등 다른 프레임워크가 필요하면 별도 문의 후 이미지 배포 가능.
  • 세션 생성 시 이미지, 자원(CPU·GPU·메모리), vFolder 마운트, Preopen Ports 설정.

STEP 3. GPU 학습 수행 및 모델 저장

  • 세션 접속 후 nvidia-smi로 GPU 인식·스펙 검증.
  • 학습 완료 모델은 즉시 NAS 폴더에 저장.
  • Multi-GPU 사용 시 CUDA_VISIBLE_DEVICES 명시적 지정 권장.

STEP 4. 모델 및 데이터 백업

  • NAS 쿼터 부족 시 기술지원 게시판을 통해 스토리지 증설 요청.
  • 사업 종료 전 SFTP로 로컬 백업.

3. VoC QnA 모음집 ver2.1 (31p)

원문: 구글 드라이브

이 문서가 다루는 범위: AI Nexus 사용자 VoC 기반 5개 카테고리 Q&A — GPU 자원 사용, 서비스/기술, 세션, 도커 이미지, 데이터 디스크.

우리 상황(Interactive 세션·H200 1장)에 해당하는 핵심 Q&A

자원 회수 상세

  • 회수 로직: 세션 생성 시점부터 Cuda Util 수집 → 최근 6시간 평균 1% 미만이면 유휴 판정 → 자원 회수. 세션 로그에 idle-utilization으로 기록됨.
  • 예외: 순간 0%라도 6시간 평균 1% 이상이면 회수 안 함 → 전처리·코드 수정 등 간헐적 작업 중 갑작스런 회수 방지.
  • 회수된 자원은 스케줄러가 즉시 공유 Pool로 환수해 대기자에게 재할당(무중단 구조).
  • 1% 기준은 사업·정책별로 협의 변경 가능. 추론(Serving) 기능 이용 시에는 회수 정책 미적용.

nvidia-smi에서 GPU가 쪼개져 보이는 현상

  • 요청한 GPU 자원량을 온전한 device로 못 채울 때 fraction 할당이 일어난다. 예: 1장 요청 시 0.5장 × 2로 보일 수 있음. 오류 아님. 원치 않으면 별도 문의.
  • 1장을 의도적으로 슬라이싱해 한 세션에 주는 것과 세션 내 MIG 슬라이싱은 불가능.

멀티노드 구성

  • 대규모 요청 시 자동으로 Main 1 + Sub N 구조가 된다. 예: 24장 = 8장 × 3세션.
  • 세션 간 Infiniband 고속 연결. Main → Sub로 ssh sub1 형태 접근 가능.
  • all-smi로 Main에서 전체 노드 GPU 상태 통합 모니터링.
  • 분산학습용 rank·master address 환경변수는 자동 설정된다.
  • 8장을 4노드로 만들면 노드당 2장씩 보이는 게 정상.

NCCL 튜닝 (컨테이너 환경 hang 대응)

  • accelerate.prepare 단계 무한 대기는 /dev/shm 부족 또는 --ipc=host 미적용 때문. GUI 세션은 Docker 옵션을 직접 못 주므로 공유 메모리 크기를 늘리고 NCCL 환경변수로 우회한다.
  • 자주 쓰는 것: NCCL_DEBUG=INFO, NCCL_ASYNC_ERROR_HANDLING=1, NCCL_P2P_DISABLE=1, NCCL_SHM_DISABLE=1, NCCL_IB_DISABLE=1.
  • accelerate 분산이 안 되면 GPU index 꼬임 → export CUDA_VISIBLE_DEVICES=0,1 명시.

세션이 Pending에서 안 넘어갈 때

  • 정상 전이: Pending → Scheduled → Preparing → Prepared → Creating → Running.
  • no-available-instances = 요청 스펙만큼 여유 자원이 없음. 기다리면 자원이 나는 대로 생성된다.
  • failed-to-start + Assertion Error = 대개 예약 포트를 preopen port로 지정한 경우. 예약 포트: 2000, 2001, 3000, 5000, 6006, 8080, 8090, 8091, 8180.
  • failed-to-start + Insufficient Error = 자원 부족. 자원이 충분한데도 나면 보정 프로세스(15~20분 주기) 타이밍 문제일 수 있으니 잠시 후 재시도.

세션 복구·로그

  • 종료된 세션은 복구 불가. 환경을 남기려면 종료 전 이미지 커밋.
  • 세션 생성 후에는 포트 개방 추가·변경 불가. 새 세션을 만들어야 한다.
  • 컨테이너 로그는 저장된다. 실행중/종료 탭의 “컨테이너 로그 보기”로 확인.

SSH 접속

  • 세션 앱 다이얼로그 → SSH/SFTP 아이콘 클릭 → 접속 주소·id_container 키 파일 다운로드.
  • ⚠️ 아이콘을 클릭해야 데몬이 활성화된다. 클릭 전에는 접속 자체가 안 된다. 끊겼으면 다시 클릭.
  • 키는 세션 재생성 때마다 바뀐다. 비밀번호는 쓰지 않고 키 파일 권한은 600.
  • 연결 끊김 방지: ssh -o ServerAliveInterval=60 -o ServerAliveCountMax=5 ... (영구 적용은 로컬 ~/.ssh/config).

VSCode 관련

  • 세션 재생성 후 연결 실패 → 로컬 ~/.ssh/known_hosts(윈도우: C:\Users\<사용자>\.ssh\known_hosts)에서 이전 세션 정보 삭제 후 재시도.
  • VSCode 종료 시 학습 동반 종료 → 터미널에서 /opt/kernel/tmux로 tmux 환경에서 실행하거나 백그라운드로 돌릴 것.

커스텀 이미지의 sudo: you do not exist in the passwd database

  • AI Nexus는 UID 1100의 work 계정을 쓰는데, 커스텀 이미지에 UID 1000짜리 work 계정이 이미 있으면 충돌한다.
  • 해결: 커스텀 이미지 빌드 시 work 계정 UID/GID를 1100으로 맞추거나, work 외 다른 이름을 쓴다.

apt 설치 시 tzdata 오류

  • /etc/localtime이 read-only 마운트라 충돌. 우회:
    export DEBIAN_FRONTEND=noninteractive
    export TZ=Asia/Seoul
    sudo apt install --no-install-recommends -y <패키>

CUDA out of memory

  • H200은 141GB HBM3e. 배치 크기·시퀀스 길이가 이 범위를 초과하면 발생. 배치 스윕으로 안전 구간 확인 후 운영.

CUDA uncorrectable ECC error

  • GPU 카드 자체 문제. 세션명·현상을 기술지원 게시판에 문의 후, 해당 세션 삭제하고 새 세션 생성. 문제 GPU는 점검 후 재투입된다.

shared memory (shm) 오류

  • worker thread 과다 또는 공유 메모리 부족. 세션 생성 시 공유 메모리를 비율로 늘려 재시도. 단 공유 메모리는 메인 메모리를 나눠 쓰는 것이라 과하게 잡으면 역효과.

데이터 디스크 관련

  • 🔴 Scratch(/home/work)와 NAS vFolder는 다르다. 할당 2TB는 NAS 쿼터이고, Scratch는 호스트 GPU 노드 로컬 디스크를 마운트한 것으로 세션당 10GB~100GB로 제한된다. 대용량은 반드시 NAS에.
  • No space left on device: 임시 파일이 Scratch를 채우는 경우. HuggingFace는 기본적으로 /home/work/.cache/huggingface/downloads에 받으므로 캐시 경로를 NAS로 돌린다(HF_DATASETS_DOWNLOADED_DATASET_PATH 등).
  • 🔴 NFS filelock 문제(정정): NAS(NFS v3)를 cache_dir로 지정하면 HuggingFace의 filelock이 멈춘다. 라이브러리에 우회 옵션이 없어, 원문은 huggingface_hub/utils/_fixes.py를 직접 수정FileLockSoftFileLock으로 바꾸라고 안내한다. 수정 전 기존 lock 파일(.cache)은 지운다.
    -from filelock import BaseFileLock, FileLock
    +from filelock import BaseFileLock, SoftFileLock
    -   lock = FileLock(lock_file)
    +   lock = SoftFileLock(lock_file)
    
  • 🔴 NAS 데이터 삭제 복구(정정): 6월 정리본의 “복구 불가”는 틀렸다. 원문은 snapshot으로 복구 가능하며 기술지원 게시판·테크센터로 문의하라고 안내한다. 단 세션 종료 후 데이터가 사라진 것처럼 보이는 경우는 대개 mv로 마운트 경로 밖으로 옮긴 것이 원인이다.
  • tar: cannot open: file too large → 수만 개 파일을 한 번에 묶지 말고 50만 개 또는 5~10GB 단위로 분할.
  • scp/rsync: Channel 0: rcvd too much datascp -o MaxPacketSize=16384 ... (안 되면 8192로 더 줄인다).
  • Caught signal 11 (Segmentation fault)ulimit -s unlimited 후 재시도.

4. VM → AI Nexus 환경 전환 가이드 (7p)

원문: 구글 드라이브

이 문서가 다루는 범위: 기존 VM/베어메탈 환경을 AI Nexus 컨테이너 환경으로 이전하는 단계별 가이드.

VM vs AI Nexus 핵심 차이

항목VM / BM 환경AI Nexus
실행 단위서버 인스턴스 (상시 가동)세션 — 필요 시 생성/종료
환경 설치OS에 직접 패키지 설치컨테이너 이미지 선택 후 pip 설치
데이터 저장서버 로컬 디스크vFolder — 세션에 마운트하여 사용
소프트웨어 영속성설치하면 유지세션 종료 시 초기화 (vFolder 내 데이터는 유지)
GPU 할당서버에 고정세션 생성 시 동적 할당

핵심 원칙: AI Nexus 컨테이너 세션은 “일시적 실행 환경”. 영속할 데이터와 코드는 반드시 vFolder에 저장.

이전 전 체크리스트

  • 현재 OS·CUDA·드라이버·Python 버전, pip freeze > requirements.txt, conda env export > environment.yml
  • 데이터셋·체크포인트 위치와 용량, Git 원격 연동 여부, 로컬에만 있는 스크립트·크론잡
  • 외부 API 키·환경변수, 사내 NFS/SMB 마운트 정보, 방화벽·포트 목록

vFolder 권장 구조

my-datasets     ← 학습 데이터셋 (대용량, 읽기 전용 공유 가능)
my-checkpoints  ← 모델 체크포인트
my-code         ← 소스 코드 (Git 연동 또는 직접 업로드)
my-outputs      ← 실험 결과, 로그

이미지 선택 예시 (원문 표기)

기존 환경권장 AI Nexus 이미지
CUDA 12.8 + PyTorch 2.7bai-repo:7080/bai/ngc-pytorch:25.03-pytorch2.7-py312-cuda12.8
CUDA 13.0 + vLLM 0.19.0bai-repo:7080/bai/vllm:0.19.0-cuda13.0-ubuntu24.04@x86_64
커스텀 환경관리자 문의

패키지 설치 전략 3가지

방법설명적합 상황
A. 세션 시작 시 자동 설치 스크립트vFolder에 setup.sh 저장 → 세션마다 실행패키지 수가 적을 때
B. 커스텀 컨테이너 이미지관리자에게 등록 요청패키지 많거나 빌드 필요할 때
C. Conda 환경을 vFolder에 저장/my-code/envs/에 Conda 환경 생성 → 재사용Python 환경 격리 필요할 때

VM 방식 → AI Nexus 대응 방법

기존 VM 방식AI Nexus 대응
~/ 홈에 파일 저장vFolder(/home/work/폴더명/)에 저장
nohup python train.py & 백그라운드 실행Batch 세션으로 제출 (세션 종료돼도 작업 유지)
screen / tmux로 세션 유지AI Nexus 터미널 세션이 동일 역할
/etc/environment에 환경변수세션 생성 시 환경변수 지정 또는 .env를 vFolder에 저장
df -h로 용량 확인WebUI vFolder 탭에서 확인

이전 후 검증 체크리스트

vFolder 업로드 확인 → 세션 내 경로 접근 확인 → requirements.txt 설치 후 import 오류 확인 → nvidia-smi / torch.cuda.is_available() → 소규모 시범 학습 → 체크포인트가 vFolder에 기록되는지 → 세션 재시작 후 vFolder 데이터 유지 확인.


5. WEBUI 기술지원 게시판 접속 가이드 (6p)

원문: 구글 드라이브

이 문서가 다루는 범위: AI Nexus 로그인 후 기술지원 게시판 접속·이용 절차.

접속 절차

  1. AI Nexus 웹UI에 로그인 (초기 비밀번호 → 즉시 변경 필수).
  2. 좌측 메뉴 NIPA 기술지원 탭 클릭.
  3. 게시판 전용 비밀번호 입력 (AI Nexus 로그인 비밀번호와 별개 — 발급 메일 참조).

게시판 구성

메뉴내용
최근 공지사항·기술지원 내역 확인
공지사항관리자 공지 확인
기술지원서비스 이용 관련 문의 등록
  • 우측 상단 고객 정보에서 참여 중인 사업·회원 정보 확인, 마이페이지에서 사용자 정보 변경(변경 시 초기 비밀번호 입력 필요).

기술지원 문의 작성 시

  • 분류: 중분류·소분류 선택 (해당 없으면 기타/기타).
  • 파일 첨부 가능.
  • 링크 첨부 시 http:// 또는 https:// 포함 URL로 작성.

문의 채널 정리

구분연락처
NIPA 기술지원 (서비스 환경 문제)AI Nexus 내 기술지원 게시판
공급사 운영 문의 (㈜콘텐츠브릿지)[email protected] / 070-4291-7005
운영기관 정책·진행 문의 (KAIT)02-580-0216 / [email protected]
사업관리시스템(PMS) 오류담당자 휴대폰 — 발급 메일 및 2026 HPC GPU 운영계획 참조

6. 🔴 사용자 교육 녹화본에서만 나온 것 (2026-08-10)

PDF 5종에는 없고 말로만 전달된 내용이다. 녹화본 2편(NIPA 총괄 신동필 수석 / kt cloud 윤민용 / 래블업 김종민·이승원)을 전사해 뽑았다.

6-1. 회수 위험 3단계 — 실제 수치

PDF는 “안전 / 경고 / 위험 3단계로 표시된다”까지만 적혀 있고 기준값이 없다. 교육에서 공개된 값:

표시기준 (CPU 또는 GPU Utilization)
위험2% 미만
경고2 ~ 8%
안전10% 이상
  • 회수 판정에서 CPU와 GPU는 AND 조건이다. 둘 다 낮아야 회수 대상이 된다(kt cloud 윤민용).
  • 이 3단계 표시는 1차 교육에서 “회수될지 UI로 알기 어렵다”는 요청을 받아 이번에 새로 넣은 기능이다.

6-2. 사용률 판정 — 사업 쪽 기준

  • 분모는 월 720시간(30일 × 24h). 예: 300시간 사용 → 가동률 약 40%.
  • 사용자 유형 구분: 우수 80% 이상 / 월별 50% 이상 / 저사용 10% 미만 / 미사용.
  • 우수 사용자는 심의를 거쳐 자원을 추가로 받을 수 있다. 반대로 저·미사용은 회수·심의 대상.
  • 10월경 만족도 조사와 중간점검 예정. 서면 제출 → 전문가 점검 → 실적 평가.

6-3. 🔴 지원 범위 — 학습이지 추론 서비스가 아니다

NIPA 총괄의 발언이 공고 문구보다 구체적이다.

  • “지원 범위는 AI 모델 학습입니다. 추론 및 상용 서비스 지원은 불가합니다.”
  • 단, 마지막 Q&A에서 스스로 범위를 좁혔다 — “추론 서비스가 안 된다는 건 맞지만, 학습할 때 검증에 필요한 것들은 가능합니다. 추론을 목적으로 하면 안 된다는 뜻이지, 데이터 검증까지 안 된다는 건 아닙니다.”
  • 즉 경계는 **“추론이 목적인가”**다. 학습·검증에 딸린 추론은 허용, 상시 서비스 운영은 불가.
  • 🔴 “이용신청서에 적은 목적과 무관하게 자원을 쓰는 사례가 발견됐다. 그런 경우 자원을 회수할 수밖에 없다.
  • 🔴 “인터페이스 세션이나 서비스 엔드포인트 등 자원 이용 현황을 지속적으로 모니터링하고 있습니다.”
  • 공급사 답변도 같은 방향 — 상시 vLLM 서빙을 하고 싶다는 질문에 “요청이 없을 때 Util이 떨어져 회수된다. 상시 운영해야 하는 추론 서비스로는 구조적으로 적합하지 않다”고 답했다.

6-4. 중도 포기·제재

  • 중도 포기 시 자부담금은 반환되지 않는다. 다만 미사용분은 환불 가능.
  • 자원심의위원회가 차년도 사업 참여 제한을 심의한다. 작년에 실제 심의 이력이 있다.
  • 심의 범위: 중도 포기, 중간·결과 성과보고서 미제출, 우수 사용자(자원 추가), 이의 제기.

6-5. 그 밖에 확인된 사실

  • 스토리지: 배정 용량의 80% 이상을 쓰면 1TB 무상 증설, 그 이후는 유상. 기술지원 게시판으로 요청.
  • SSH 접속 정보: 세션이 떠 있는 동안은 불변. 삭제·회수 후 재생성하면 도메인·포트가 바뀐다. 방화벽에 등록하려면 운영 도메인 3개 + 랜덤 포트 범위 전체를 넣어야 한다.
  • 커밋 이미지는 자체 Harbor 레지스트리에 프라이빗으로 올라가고 사용자 본인에게만 노출된다(토큰을 이미지에 넣어도 외부 공개 안 됨 — 다만 권장할 일은 아니다).
  • 8장 이상 멀티노드 생성 시 Infiniband 연결. NVLink도 지원.
  • 허용된 클라이언트 IP는 꼭 필요한 경우가 아니면 비워두는 것을 권장(잘못 넣으면 본인이 잠긴다).
  • 사전 개방 포트 외에 시스템이 점유 중인 포트가 따로 있어 지정할 수 없다.
  • 사업은 단년도(1/1~12/31). 내년은 다시 공고·모집·선정 절차를 밟는다. 예산은 증액 예정이라는 언급.
  • 사업 종료 시 자원 전량 회수 — 백업 기간 내 데이터 반출 필수.
  • 영문 가이드는 별도 확인 후 제공하기로 함(현장 질의).

전사 원문: _work/hpc_edu_20260812/edu1.txt(1시간 53분·1,309세그먼트), edu2.txt(29분·354세그먼트). 넥서스 H200 + faster-whisper large-v3로 전사(실시간 대비 약 13배속). 자동 전사라 고유명사·수치에 오인식이 섞여 있을 수 있어, 위에 옮긴 항목은 PDF·공고와 교차 확인한 것만 남겼다.


원본 자료 (2026-08-11 배포분)

㈜콘텐츠브릿지가 8/11 메일로 공유한 구글 드라이브 폴더.

녹화본길이내용링크
NIPA 고성능 컴퓨팅 사업 추가모집 사용자 교육 (2026-08-10)1시간 53분사업 운영·관리 설명(NIPA) + AI Nexus 실습 + 사전질의 Q&A영상
고성능 컴퓨팅 사업(GPU) 사용자 교육29분 27초AI Nexus 서비스 구조 + 멀티노드 세션 핸즈온영상

드라이브 메타데이터에는 1번 영상 길이가 0으로 기록돼 있으나 실제 1시간 53분이다. 두 편 모두 전사해 6번 절에 반영했다.

6월 배포분 폴더(이전 버전): HPC 2026 매뉴얼 폴더