Overview

서비스 개요

Simple AI Training은 데이터 과학자와 머신러닝 엔지니어가 인프라 관리 부담 없이 대규모로 모델을 학습시킬 수 있는 완전 관리형 AI Training 서비스입니다. Simple AI Training 서비스를 통해 환경을 위한 별도의 AI 인프라, 플랫폼 없이 데이터와 학습 코드만 준비하여 손쉽게 모델 학습을 처리하고 결과를 도출할 수 있습니다.

특장점

  • 인프라 관리의 복잡성 제거: Simple AI Training의 서비스 백그라운드에서 서비스를 위한 요소를 자동으로 구성하고 서비스 종료 후 자원을 회수하여 별도의 인프라 운영이 필요하지 않습니다.
  • 손쉽고 빠른 모델 학습: 복잡한 명령어(CLI) 대신 웹 콘솔 인터페이스를 통해 몇 번의 클릭만으로 모델 학습 작업을 실행할 수 있습니다. 사용자는 학습 스크립트와 데이터가 위치한 스토리지 위치 및 GPU 인스턴스만 지정하면 됩니다.
  • 보안성 높은 데이터 퍼리: 클라우드 내 데이터 저장소(Object Storage 등)와 직접 연동되어 외부 유출 걱정 없이 보안이 유지된 상태로 대용량 데이터를 처리합니다.
  • 안정적인 모델 학습: 학습 도중 인프라 오류가 발생하더라도 시스템이 자동으로 장애를 탐지하고 복구하여 중단 없는 학습 환경을 제공합니다.
  • 효율적인 비용 관리: 우선순위가 낮은 학습에 대해 유휴 GPU를 사용하거나 Samsung Cloud Platform이 Spot 중단 및 재개를 자동으로 관리하여 비용 효율적인 학습이 가능합니다.

서비스 구성도

구성도
그림. Simple AI Training 구성도

제공 기능

Simple AI Training는 다음과 같은 기능을 제공하고 있습니다.

  • 서버리스 환경 제공: 인프라 설정, 데이터 로딩, 모델 학습, 결과물 저장까지 모든 과정을 자동화하여 학습에만 집중할 수 있습니다.
  • 분산 학습 및 Warm Pool 지원: 대규모 모델이나 대용량 데이터셋을 여러 인스턴스에 자동으로 분산하고 연속적인 훈련 작업 시에는 인스턴스를 즉시 재사용하여 인프라 프로비저닝 시간을 단축합니다.
  • 커스텀 컨테이너 지원: 사용자의 Docker 컨테이너 이미지를 가져와 학습할 수 있습니다(BYOC: Bring Your Own Container).
  • 모델 훈련 가용성: GPU Failover, Checkpointing 기능을 지원하여 모델 훈련을 원활하게 진행할 수 있습니다.
    • GPU Failover: 학습 도중 GPU 오류 발생 시 시스템이 자동으로 장애를 탐지 및 복구하여 오류로 인한 중단을 방지합니다.
    • Curcurrent Checkpointing: 학습 중간 결과물을 Object Storage에 저장하여 장애 발생 시 체크포인트부터 다시 학습을 재개할 수 있습니다.
  • 안전한 데이터 접근: 클라우드 내 데이터 저장소(Object Storage)와 연동되어 데이터를 외부 유출 걱정없이 보안이 유지된 상태로 처리할 수 있습니다.
  • 다양한 요금제 제공: 다양한 요금제를 제공하여 비용을 절감하고 효율적인 학습을 수행할 수 있습니다.
안내
커스텀 컨테이너 기능은 2026년 9월 제공 예정입니다.

제공 서버

Simple AI Training에서는 g2 서버 타입(H100)과 g3 서버 타입(B300)을 제공합니다.
서버 타입에 대한 자세한 사양은 서버 타입을 참고하세요.

구분인스턴스 타입
g2at.g2v12h1, at.g2v24h2, at.g2v48h4, at.g2v96h8, at.g2.spot
g3at.g3v16b1, at.g3v16b2, at.g3v16b4, at.g3v16b8, at.g3.spot
표. Simple AI Training 제공 서버

리전별 제공 현황

Simple AI Training 서비스를 제공하는 리전은 다음과 같습니다.

리전제공 여부
한국 서부(kr-west1)제공
한국 동부(kr-east1)미제공
한국 남부1(kr-south1)미제공
한국 남부2(kr-south2)미제공
한국 남부3(kr-south3)미제공
표. Simple AI Training 리전별 제공 현황

선행 서비스

해당 서비스를 생성하기 전에 미리 구성되어 있어야 하는 서비스 목록입니다. 자세한 내용은 각 서비스 별로 제공되는 가이드를 참고하여 사전에 준비하세요.

서비스 카테고리서비스상세 설명
StorageFile Storage네트워크 연결을 통하여 다수의 클라이언트 서버가 파일을 공유하는 스토리지
StorageObject Storage데이터 저장 및 검색에 용이한 객체 스토리지
ContainerContainer Registry컨테이너 이미지를 손쉽게 저장, 관리, 공유하는 서비스
표. Simple AI Training 선행 서비스

1 - 서버 타입

Simple AI Training은 제공하는 GPU Type에 따라 구분되며, Training Job을 생성할 때 선택하는 서버 타입에 따라 Simple AI Training에 사용되는 GPU가 결정됩니다.
Simple AI Training에서 실행하려는 작업의 사양에 따라 서버 타입을 선택하세요.
Simple AI Training에서 지원하는 서버 타입은 다음 형식과 같습니다.

at.g3v16b1
구분
예시상세 설명
서비스구분atSimple AI Training 서비스를 의미
서버 세대g3제공하는 서버 구분과 세대
  • 영문은 서버 사양을 의미
    • g: GPU 서버 사양을 의미
  • 숫자는 세대를 의미
    • 3은 3세대를 의미
CPUv16vCore 개수
  • v16: 할당 vCore는 가상 코어
GPUb1GPU 종류 및 수량
  • 영문은 GPU 종류를 의미
    • b: GPU 종류
  • 숫자는 GPU 수량을 의미
    • 8: GPU 수량
표. Simple AI Training 서버 타입 형식

g2 서버 타입

g2 서버 타입은 NVIDIA H100 SXM GPU를 사용하는 GPU Bare Metal Server로 대규모 고성능 AI 연산에 적합합니다.

  • 8개의 NVIDIA Hopper Architecture 기반 H100 GPU 제공
  • GPU 당 1,979 TFLOPS FP8 Tensor Core 성능 제공, 989 TFLOPS FP16 Tensor Core 성능 제공
  • 최대 96개의 vCPU 및 2,048 GB의 메모리를 지원
  • 최대 1,600 Gb/s NVIDIA InfiniBand RDMA 네트워크 지원
  • 최대 100 Gbps의 서비스 네트워크
  • 노드 내 NVSwitch를 통한 900 GB/s의 GPU P2P 통신
인스턴스 구분vCPUMemoryGPULocal Disk
at.g2v12h112234110 Gi
at.g2v24h224468220 Gi
at.g2v48h448936440 Gi
at.g2v96h8961,872880 Gi
at.g2.spot12234110 Gi
표. Multi-node GPU Cluster > H100 서버 타입

g3 서버 타입

g3 서버 타입은 NVIDIA B300 SXM GPU를 사용하는 GPU Bare Metal Server로 대규모 고성능 AI 연산 뿐만 아니라 생성형 AI를 위한 LLM 추론 및 AI 배포에 적합합니다.

  • 8개의 NVIDIA Blackwell Ultra Architecture 기반 B300 GPU 제공
  • GPU 당 13.5 PFLOPS FP4 Tensor Core, 4.5 PFLOPS FP8 Tensor Core 성능 제공
  • 최대 128개의 vCPU 및 4,096 GB의 메모리를 지원
  • 최대 6,400 Gb/s NVIDIA InfiniBand RDMA 네트워크 지원
  • 최대 100 Gbps의 서비스 네트워크
  • 노드 내 NVSwitch를 통한 1.8 TB/s의 GPU P2P 통신
인스턴스 구분vCPUMemoryGPULocal Disk
at.g3v16b116480110 Gi
at.g3v32b232960220 Gi
at.g3v64b4641,920440 Gi
at.g3v128b81283,840880 Gi
at.g3.spot16480110 Gi
표. Multi-node GPU Cluster > B300 서버 타입

2 - ServiceWatch 지표

Simple AI Training은 ServiceWatch로 지표를 전송합니다. 기본 모니터링으로 제공되는 지표는 5분 주기로 수집된 데이터입니다.

참고
ServiceWatch에서 지표를 확인하는 방법은 ServiceWatch 가이드를 참고하세요.

기본 지표

다음은 네임스페이스 Simple AI Training에 대한 기본 지표입니다.
아래에서 지표명이 굵은 글씨로 표기된 지표는 Simple AI Training에서 제공하는 기본 지표 중 주요 지표로 선정한 지표입니다.
주요 지표는 ServiceWatch에서 서비스별로 자동으로 구축되는 서비스 대시보드를 구성하는데 활용됩니다.
각 지표는 해당 지표를 조회할 때 어떤 통계값으로 조회하는 것이 의미있는지 의미 있는 통계값을 사용자 가이드를 통해 안내하고 있으며, 의미있는 통계 중에서 굵은 글씨로 표기된 통계값이 주요 통계값입니다.

서비스 대시보드 또는 모니터링 탭에서는 주요 지표를 주요 통계값을 통해 조회할수 있습니다. 또는 Simple AI Training 상세 페이지의 모니터링 탭에서도 주요 지표에 대해 확인할 수 있습니다.
ServiceWatch의 지표 메뉴에서 GPU Device별 사용률도 확인할 수 있습니다.

성능 항목(지표명)상세 설명단위의미있는 통계
CPU UsageTraining Job Pod에서 최근 5분 동안 사용한 평균 CPU Core 수Cores
  • 합계
  • 평균
  • 최대
  • 최저
GPU UtilizationTraining Job에서 사용 중인 GPU의 사용률Percent
  • 평균
  • 최대
  • 최저
Memory UsageTraining Job Pod에서 현재 사용 중인 메모리 사용Bytes
  • 합계
  • 평균
  • 최대
  • 최저
표. Simple AI Training 기본 지표