Overview

서비스 개요

Simple AI Inference는 다양한 글로벌 파운데이션 모델을 API 형태로 제공하는 Serverless 서비스로써 LLM을 Samsung Cloud Platform 내부 자원이나 외부에서 사용할 수 있도록 Public 또는 Private 환경을 제공합니다.
Simple AI Inference를 이용하면 동일 API를 통해 여러 LLM 모델을 사용하고 AI 애플리케이션 서비스 개발 생산성을 향상시킬 수 있습니다. 또한 OpenAI 및 LangChain SDK와 호환성을 지원하여 기존 개발 환경 및 프레임워크에 손쉽게 연동할 수 있습니다.

특장점

  • 편리한 LLM 모델 사용: Serverless 형태의 완전 관리형 서비스로써 동일 API를 통해 여러 LLM 모델을 사용할 수 있습니다.
  • 효율적인 비용관리: 입력(Input) 및 출력(Output) 토큰의 실제 사용량을 기준으로 비용이 과금됩니다.
  • 안정적인 서비스 제공: 트래픽 컨트롤(TPM/RTM)을 통하여 안정적인 서비스를 제공합니다.
  • 기업용 보안 제공: 데이터는 철저한 보안 환경에서 안전하게 보호되며 외부 모델 학습에 사용되지 않습니다.

서비스 구성도

구성도
그림. Simple AI Inference 구성도

제공 기능

Simple AI Inference는 다음과 같은 기능을 제공하고 있습니다.

  • 편리한 LLM 모델 확인

    • LLM 모델 카탈로그를 통해 제공되는 LLM 모델의 특징 및 주요 활용처들을 쉽게 확인할 수 있습니다.
    • PlayGround를 이용하여 제공되는 LLM 모델을 콘솔 화면에서 바로 확인하고 테스트할 수 있습니다.
      참고
      PlayGround는 2026년 9월 이후 제공될 예정입니다.
  • LLM 모델의 Account 공동 사용: Simple AI Inference에서 사용할 모델을 신청하면 동일 Account 내의 모든 사용자가 사용할 수 있습니다.

  • Serverless 서비스 제공 : 사용자는 자원의 관리 없이 API를 통해 원하는 모델을 요청하여 바로 사용할 수 있으며 사용한 만큼 비용을 지불하게 됩니다.

  • Public/Private 엔드 포인트 제공: 사용자의 추론 사용 형태에 따라 Public 또는 Private 엔드 포인트를 선택하여 사용할 수 있습니다.

  • 안정적인 서비스 제공: 트래픽 컨트롤(TPM/RPM)을 통해 안정적인 서비스 환경을 제공합니다.

제공 모델

Simple AI Inference에서 제공하는 LLM 모델은 다음과 같습니다.

모델명활용처입력 타입TPMRPMContext Size이미지 입력 제한 수
Qwen3.6-27BText, AgentText, Image1,000,000100262,1448
gemma-4-31B-itText, AgentText, Image1,000,000100262,1448
gpt-oss-120bTextText1,000,000100131,072-
Llama-Guard-4-12BSecurityText, Image1,000,000250307,2008
Qwen3-VL-Embedding-8BembeddingText, Image1,000,000250262,1448
Qwen3-VL-Reranker-8BrerankerText, Image1,000,000250262,1448
표. Simple AI Inference 제공 LLM 모델

주의
Simple AI Inference 서비스에서 제공하는 모델은 인공지능 모델이 학습된 데이터를 바탕으로 자체 생성한 결과물입니다. 따라서 모델이 생성한 답변 내용, 의견, 가치관 및 판단은 Samsung Cloud Platform의 공식 입장이나 의도와는 완전히 무관합니다. 또한 AI 모델의 특성상 왜곡된 정보나 오류가 포함된 답변(환각 현상)이 발생할 수 있으므로, 중요한 의사결정 시에는 반드시 사실 관계를 별도로 확인하시기 바랍니다.

리전별 제공 현황

Simple AI Inference 서비스를 제공하는 리전은 다음과 같습니다.

리전제공 여부
한국 서부(kr-west1)제공
한국 동부(kr-east1)미제공
한국 남부1(kr-south1)미제공
한국 남부2(kr-south2)미제공
한국 남부3(kr-south3)미제공
표. Simple AI Inference 리전별 제공 현황

선행 서비스

해당 서비스를 생성하기 전에 미리 구성되어 있어야 하는 서비스는 없습니다.

1 - ServiceWatch 지표

Simple AI Inference은 ServiceWatch로 지표를 전송합니다. 기본 모니터링으로 제공되는 지표는 5분 주기로 수집된 데이터입니다.

참고
ServiceWatch에서 지표를 확인하는 방법은 ServiceWatch 가이드를 참고하세요.

기본 지표

다음은 네임스페이스 Simple AI Inference에 대한 기본 지표입니다.
아래에서 지표명이 굵은 글씨로 표기된 지표는 Simple AI Inference에서 제공하는 기본 지표 중 주요 지표로 선정한 지표입니다.
주요 지표는 ServiceWatch에서 서비스별로 자동으로 구축되는 서비스 대시보드를 구성하는데 활용됩니다.
각 지표는 해당 지표를 조회할 때 어떤 통계값으로 조회하는 것이 의미있는지 의미 있는 통계값을 사용자 가이드를 통해 안내하고 있으며, 의미있는 통계 중에서 굵은 글씨로 표기된 통계값이 주요 통계값입니다.

서비스 대시보드 또는 모니터링 탭에서는 주요 지표를 주요 통계값을 통해 조회할수 있습니다. 또는 Simple AI Inference 상세 페이지의 모니터링 탭에서도 주요 지표에 대해 확인할 수 있습니다.
ServiceWatch의 지표 메뉴에서 GPU Device별 사용률도 확인할 수 있습니다.

성능 항목(지표명)상세 설명단위의미있는 통계
Model Total Tokens모델 토큰 사용량(전체)Count
  • 합계
Model Request Server Error모델 요청 실패 횟수(서버 오류)Count
  • 합계
Model Input Tokens모델 토큰 사용량(입력, 캐시된 토큰 포함)Count
  • 합계
Model Request Throttled모델 요청 제한 횟수(요청 한도 초과)Count
  • 합계
Model Request Client Error모델 요청 실패 횟수(클라이언트 오류)Count
  • 합계
Model Output Tokens모델 토큰 사용량(출력)Count
  • 합계
Model Cached Tokens모델 토큰 사용량(캐시)Count
  • 합계
Model Request Prompt Rejected모델 요청 거부 횟수(프롬프트 검수)Count
  • 합계
Model Request Success모델 요청 성공 횟수Count
  • 합계
표. Simple AI Inference 기본 지표