데이터센터 & AI/VAST Storage

VAST Fundementals(101) - VMS(Vast Management System)

의그 2026. 7. 18. 11:14

VMS 기본 UI

 

VAST Data Element Store

하나의 데이터를 여러 프로토콜(NFS, SMB, S3 등)에서 동시에 접근할 수 있는 Unified Storage

프로토콜 : 데이터를 "어떻게 접근할 것인가"

Element Store : 실제로 데이터가 저장되는 곳 / Metadata(SCM) + Data(Flash)

Metadata : SCM에 저장됨. 메타데이터는 자주 접근해야되기 때문.

- metadata, locks, snapshots, keys, catalog, audit log 등

Data : Hyperscale Flash(NVMe SSD)에 저장됨

- image.jpg, model.pt, checkpoint.bin 등

 

예) Linux 서버에서는 NFS로 읽고, Windows에서는 SMB로 읽고, Cloud Application은 S3 API로 읽고, Data Scientist는 Pythion, SQL, Arrow로 분석할 수 있다.

 

예전 스토리지는 NFS 저장공간, SMB 저장공간, S3 저장공간이 따로 있었으나 VAST는 하나의 데이터를 여러 프로토콜에서 접근할 수 있는 것.


View라는 개념.

NetApp 등의 전통 NAS는 NFS Export, SMB Share, S3 Bucket이 전부 따로 있다.

NFS -> /home

SMB -> //home

S3 -> bucket-home

전부 각각 관리해야 한다.

 

VAST에서는 View만 만든다.

View는 사용자가 데이터를 어떻게 볼 것인가를 정의한다.

예) Engineering View를 만들면 동시에 NFS, SMB, S3 사용 가능

 

Path와 View의 차이

Path : 데이터가 실제 있는 위치

View : 사용자가 보는 방식

예)

Path - 실제 데이터가 /vast/data/projects/AI 에 있음

View - 리눅스는 /mnt/AI 로 보게 하고, Windows에서는 \\AI 로 보게 하고, S3에서는 bucket-ai 로 보게 함

 

비유하자면,

Path : 서울시 강남구 테헤란로 123 (실제 주소)

View : 회사 직원->본사 / 택배기사->물류센터 / 고객->A센

 

즉,

  • Path는 데이터가 실제 저장된 위치다.
  • View는 그 데이터를 어떤 프로토콜(NFS, SMB, S3 등)로 사용자에게 보여줄지 정의하는 접근 방식이다.
  • VAST는 하나의 Element Store에 데이터를 저장하고, 여러 View를 통해 동일한 데이터를 동시에 다양한 프로토콜로 제공한다.

이 구조 덕분에 AI 학습 서버(NFS), 윈도우 사용자(SMB), 클라우드 애플리케이션(S3), 데이터 분석 도구(SQL/Python)가 같은 데이터를 복사 없이 동시에 사용할 수 있는 것이 VAST의 가장 큰 장점 중 하나다.

 

View Policy

누가 접속 가능? NFS만? SMB도? Root 권한은? VIP는 어디? ACL은? Audit은? 이와 같은 정책 설정

1. Apply to one or more Views : 하나의 Policy를 여러 View에 동시 적용 가능

2. Define Security Flavor : NFS 인증 방식을 무엇으로 할 것인가? AUTH_SYS, Kerberos, LDAP 등

  * AUTH_SYS : UID/GID 기반, 가장 일반적

  * Kerberos : 사용자 인증, 보안 높음, 기업 환경에서 많이 사용

3. Define which VIP Pools are used

VIP : Virtual IP

VAST는 C노드가 여러개 있다. 클라이언트는 10.10.10.100이라는 VIP로 접속한다.

클라이언트는 자동으로 C1 또는 C2 또는 C3로 연결된다.

'Policy에서 이 View는 VIP Pool A만 사용' 처럼 지정할 수 있다.

 

Add Policy 화면에서,

Tenant : 어느 Tenant 소속인지, 멀티테넌트 환경에서 사용 - default 

Name : Policy 이름 - GPU_POLICY

Security Flavor : 어느 인증 방식 - AUTH_SYS, Kerberos, LDAP 중 선택

VIP Pools : 어느 VIP를 사용할지 - AI Cluster VIP 10.10.10.x

Host-Based Access : 어느 서버가 접속 가능한가 - 10.0.0.0/24 허용, 192.168.1.0 거부

NFS4.1 : NFS 전용 옵션 - Root Squash, ACL, NFS옵션 등

Default POSIX modebits : 리눅스 권한 755, 775, 700 같은 기본 권한 지정

S3 : S3 Bucket으로 사용할 경우 관련 옵션

Auditing : 누가 삭제/읽기/쓰기 를 했는지 로그를 남김

   Advanced

   - Path Length Limit(파일 이름 길이 제한)

   - Allowed Characters(허용 문자) - /, *, ?, % 등 제한

Atime Frequency : Access Time(파일을 언제 읽었는지)을 얼마나 자주 업데이트할 것인지

  읽을 때마다 Metadata Write가 발생하기 때문에 꺼두는 경우가 많음

Use 32-bit File IDs : 옛날 시스템 호환성

NFS Posix ACL : ACL 사용 여부

SMB Continuous Availability : SMB 장애 조치, Failover 옵션

 

예를 들어 GPU 서버 127대가 있다.

이 서버들은 NFS만 사용한다.

그러면,

View -> AI_DATASET -> Policy Security AUTH_SYS Host gpu001~127 VIP AI_VIP Root접근허용 이렇게 하나 만들어둔다.

Windows 사용자는 다른 View를 만들고 -> SMB AD인증 읽기전용 Policy를 붙이면 된다.

같은 데이터인데 접근 방식과 권한만 달라지는 것이다.

 

-----

 

Security Flavors : NFS / SMB / Mixed-Last-Wins / S3 Native

 

-----

 

Performance & Capacity Monitoring

GPU 학습 속도가 갑자기 느려졌다고 하면, 다음 순서로 확인하는 것이 일반적이다.

  1. Analytics → Read Latency, Metadata Latency, IOPS에 이상이 있는지 확인
  2. Top Actors → 특정 GPU 노드나 Job이 과도한 I/O를 발생시키는지 확인
  3. Data Flow → 문제가 특정 C-node, D-node 또는 VIP 경로에 집중되는지 확인
  4. Capacity → 용량 부족이나 Data Reduction 변화로 인한 영향이 있는지 확인

이 네 메뉴만 제대로 활용해도 대부분의 용량 문제, 성능 저하, 특정 클라이언트의 과도한 사용, 데이터 경로 문제를 빠르게 진단할 수 있다.