고성능 컴퓨팅
IT 위키
더 많은 작업
- High-Performance Computing; HPC; 고성능 컴퓨팅, 슈퍼컴퓨팅
- 많은 계산 노드를 고속 네트워크로 묶어 병렬로 대규모 시뮬레이션, 빅데이터 분석, AI 모델 학습을 수행하는 컴퓨팅 시스템과 그 보안
고성능 컴퓨팅(HPC)은 한 대의 컴퓨터로는 오래 걸리는 계산을 수백~수만 개의 계산 노드에 나눠 동시에 처리한다. 기상·기후 예측, 신약·재료 시뮬레이션, 유체 해석, 핵·국방 연구, 그리고 최근에는 대규모 AI 모델 학습이 대표적인 용도이다. 슈퍼컴퓨터는 이런 HPC 시스템 가운데 성능이 최상위인 것을 가리키는 말이다.
HPC는 성능이 최우선 요구사항이라는 점에서 일반 기업 IT와 다르다. 보안 통제가 계산 속도나 네트워크 지연을 늘리면 운영자가 그 통제를 끄려는 압력이 생긴다. NIST는 이런 특성을 반영해 2024년 2월 SP 800-223(HPC 보안 아키텍처·위협 분석)을, 2026년 5월 SP 800-234(HPC 보안 오버레이)를 최종 발행했다.
| 구성 요소 | 설명 |
|---|---|
| 계산 노드(compute node) | CPU, 메모리, 네트워크 카드를 갖춘 개별 서버. GPU 같은 가속기를 단다. 로컬 디스크 없이 원격 저장소를 쓰기도 한다 |
| 클러스터 | 독립된 계산 노드들을 고속 네트워크로 묶은 집합. 하나의 작업을 여러 노드가 나눠 처리한다 |
| 인터커넥트(interconnect) | 노드 사이를 잇는 고속·저지연 네트워크. InfiniBand, Omni-Path, Slingshot, 이더넷 등이 쓰인다. 원격 직접 메모리 접근(RDMA)을 많이 사용한다 |
| 병렬 파일시스템(parallel file system) | 매우 큰 데이터 세트를 여러 노드가 동시에 빠르게 읽고 쓰도록 만든 공유 저장소 |
| 작업 스케줄러(scheduler, workload manager) | 사용자가 제출한 작업(job)에 노드와 시간을 배정한다. Slurm, 쿠버네티스 등이 예이다 |
| 병렬 프로그래밍 | MPI 같은 메시지 전달 방식과 GPU 프로그래밍으로 계산을 나눈다 |
SP 800-223은 HPC 시스템을 네 개의 기능 구역(zone)으로 나눠 위협과 대책을 정리한다.
| 구역 | 역할 | 주요 위협 |
|---|---|---|
| 접근 구역(access zone) | 로그인 노드, 웹 포털, 데이터 전송 노드. 외부 네트워크와 직접 연결되는 유일한 구역으로 사용자 인증·인가를 맡는다 | 서비스 거부, 무차별 대입 로그인, 세션 하이재킹, 중간자 공격 |
| 관리 구역(management zone) | 시스템 관리, 대역 외 하드웨어 관리, 스케줄러, 워크플로 관리 | 사용자를 대신해 동작하는 특권 프로세스(스케줄러 등)가 침해되면 권한 상승 |
| 고성능 계산 구역(high-performance computing zone) | 계산 노드와 고속 네트워크 | 여러 사용자가 노드를 공유하는 데서 오는 사이드 채널, 데이터 유출, 컨테이너 탈출, 미션과 무관한 자원 남용 |
| 데이터 저장 구역(data storage zone) | 병렬 파일시스템, 아카이브 저장소, 버스트 버퍼 | 데이터 삭제·오염·허위 데이터 주입, 메타데이터를 통한 정보 노출, 대량 디스크 고장 |
- 성능 우선 설계: 가속기, 고속 인터커넥트, 노드 간 직접 메모리 접근은 보안 관점에서 충분히 검증되지 않은 경우가 있고, 속도와 복잡성 때문에 이상 행위 감시가 어렵다(SP 800-223).
- 공유 파일시스템: 사용자 사이의 경계가 POSIX 파일 권한 정도에 그치는 경우가 많다. 권한 설정 실수 하나로 다른 연구팀 데이터가 노출된다.
- 사용자 격리 부족: 계산 노드를 여러 사용자가 공유하므로 다른 사용자의 프로세스나 메모리 잔여 데이터에 접근할 여지가 있다.
- 작업 스크립트 악용: 사용자가 제출하는 작업 스크립트와 사용자 빌드 소프트웨어는 사실상 임의 코드 실행이다. 의존성이 많은 과학 소프트웨어 스택은 공급망 공격의 통로가 된다.
- 연구 데이터 보호: 미공개 연구 결과, 국방·수출 통제 대상 기술, 개인 의료 데이터, 학습 중인 AI 모델 가중치가 함께 저장된다. 데이터 분류와 프로젝트별 접근통제가 필요하다.
- 암호화폐 채굴 악용: 막대한 연산 자원은 탈취 계정을 이용한 무단 채굴의 표적이 된다. MITRE ATT&CK은 이를 자원 하이재킹(Resource Hijacking, T1496)으로 분류한다. 정상 사용자가 미션과 무관한 계산을 돌리는 내부 남용도 같은 문제이다.
- 개방된 연구 환경: 대학·연구소 HPC는 외부 공동 연구자 계정이 많고 계정 수명 주기 관리가 느슨해지기 쉽다.
| 영역 | 대책 |
|---|---|
| 구역 분리 | 접근 구역만 외부에 노출하고, 관리 구역과 계산 구역은 내부망으로 분리한다. 관리 구역에서 계산 노드로만 관리 통신을 허용한다 |
| 인증 | 로그인 노드에 다중 인증과 SSH 키 관리, 공동 연구자 계정의 만료일 지정 |
| 스케줄러·특권 프로세스 | 스케줄러와 관리 도구를 최소 권한으로 운영하고 설정 변경을 감사한다 |
| 데이터 | 프로젝트별 그룹 권한, 민감 데이터용 별도 파일시스템, 저장 데이터 암호화(성능 영향 평가 후) |
| 노드 격리 | 민감 작업에 노드 전용 할당, 작업 종료 후 메모리·로컬 디스크 정리 |
| 모니터링 | 스케줄러 로그와 자원 사용량을 비교해 비정상 장시간 작업, 채굴 패턴, 외부 통신을 탐지 |
| 통제 기준 | SP 800-234는 SP 800-53B 중간(moderate) 기준선을 바탕으로 SP 800-53 통제 60개에 HPC용 보충 지침을 붙인 오버레이를 제공한다 |
대규모 AI 모델 학습 클러스터는 GPU 노드, 고속 인터커넥트, 병렬 저장소, 작업 스케줄러로 이뤄져 구조상 HPC와 같다. SP 800-234도 HPC의 용도로 AI·기계 학습 모델 학습을 명시한다. 따라서 HPC 보안 쟁점이 그대로 적용되고, 추가로 학습 데이터 오염(data poisoning) 방지를 위한 데이터 무결성, 모델 가중치 탈취 방지를 위한 저장소 접근통제와 반출 감시가 중요해진다.
- HPC의 핵심 특성은 성능 우선이다. 통제를 고를 때 "성능 영향을 평가한 뒤 위험 기반으로 적용"하는 답이 관리자 관점의 정답이다.
- 외부에 노출되는 것은 접근 구역(로그인 노드)이다. 경계 방어와 강한 인증은 여기에 집중한다.
- 공유 파일시스템과 공유 노드는 사용자 간 데이터 노출 위험을 만든다. 데이터 분류와 프로젝트별 접근통제로 대응한다.
- 비정상적인 자원 사용은 암호화폐 채굴 같은 자원 하이재킹의 징후이다.
- AI 학습 클러스터는 HPC의 한 형태로 보고, 데이터 무결성과 모델 보호를 추가로 고려한다.