서비스 개요
Simple AI Inference는 다양한 글로벌 파운데이션 모델을 API 형태로 제공하는 Serverless 서비스로써 LLM을 Samsung Cloud Platform 내부 자원이나 외부에서 사용할 수 있도록 Public 또는 Private 환경을 제공합니다.
Simple AI Inference를 이용하면 동일 API를 통해 여러 LLM 모델을 사용하고 AI 애플리케이션 서비스 개발 생산성을 향상시킬 수 있습니다. 또한 OpenAI 및 LangChain SDK와 호환성을 지원하여 기존 개발 환경 및 프레임워크에 손쉽게 연동할 수 있습니다.
특장점
- 편리한 LLM 모델 사용: Serverless 형태의 완전 관리형 서비스로써 동일 API를 통해 여러 LLM 모델을 사용할 수 있습니다.
- 효율적인 비용관리: 입력(Input) 및 출력(Output) 토큰의 실제 사용량을 기준으로 비용이 과금됩니다.
- 안정적인 서비스 제공: 트래픽 컨트롤(TPM/RTM)을 통하여 안정적인 서비스를 제공합니다.
- 기업용 보안 제공: 데이터는 철저한 보안 환경에서 안전하게 보호되며 외부 모델 학습에 사용되지 않습니다.
서비스 구성도
제공 기능
Simple AI Inference는 다음과 같은 기능을 제공하고 있습니다.
편리한 LLM 모델 확인
- LLM 모델 카탈로그를 통해 제공되는 LLM 모델의 특징 및 주요 활용처들을 쉽게 확인할 수 있습니다.
- PlayGround를 이용하여 제공되는 LLM 모델을 콘솔 화면에서 바로 확인하고 테스트할 수 있습니다.참고PlayGround는 2026년 9월 이후 제공될 예정입니다.
LLM 모델의 Account 공동 사용: Simple AI Inference에서 사용할 모델을 신청하면 동일 Account 내의 모든 사용자가 사용할 수 있습니다.
Serverless 서비스 제공 : 사용자는 자원의 관리 없이 API를 통해 원하는 모델을 요청하여 바로 사용할 수 있으며 사용한 만큼 비용을 지불하게 됩니다.
Public/Private 엔드 포인트 제공: 사용자의 추론 사용 형태에 따라 Public 또는 Private 엔드 포인트를 선택하여 사용할 수 있습니다.
안정적인 서비스 제공: 트래픽 컨트롤(TPM/RPM)을 통해 안정적인 서비스 환경을 제공합니다.
제공 모델
Simple AI Inference에서 제공하는 LLM 모델은 다음과 같습니다.
| 모델명 | 활용처 | 입력 타입 | TPM | RPM | Context Size | 이미지 입력 제한 수 |
|---|---|---|---|---|---|---|
| Qwen3.6-27B | Text, Agent | Text, Image | 1,000,000 | 100 | 262,144 | 8 |
| gemma-4-31B-it | Text, Agent | Text, Image | 1,000,000 | 100 | 262,144 | 8 |
| gpt-oss-120b | Text | Text | 1,000,000 | 100 | 131,072 | - |
| Llama-Guard-4-12B | Security | Text, Image | 1,000,000 | 250 | 307,200 | 8 |
| Qwen3-VL-Embedding-8B | embedding | Text, Image | 1,000,000 | 250 | 262,144 | 8 |
| Qwen3-VL-Reranker-8B | reranker | Text, Image | 1,000,000 | 250 | 262,144 | 8 |
리전별 제공 현황
Simple AI Inference 서비스를 제공하는 리전은 다음과 같습니다.
| 리전 | 제공 여부 |
|---|---|
| 한국 서부(kr-west1) | 제공 |
| 한국 동부(kr-east1) | 미제공 |
| 한국 남부1(kr-south1) | 미제공 |
| 한국 남부2(kr-south2) | 미제공 |
| 한국 남부3(kr-south3) | 미제공 |
선행 서비스
해당 서비스를 생성하기 전에 미리 구성되어 있어야 하는 서비스는 없습니다.
