> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

# 사용 가능한 모델

> Serverless Inference에서 사용할 수 있는 파운데이션 모델을 살펴보세요


Serverless Inference를 사용하면 여러 오픈 소스 파운데이션 모델에 액세스할 수 있습니다. 모델마다 강점과 활용 사례가 다릅니다.

<h2 id="generally-available-models">
  정식 출시된 모델
</h2>

다음 모델은 [정식 출시(GA)](/ko/products/inference/serverless/lifecycle#model-lifecycle-stages) 상태입니다.

| 모델 | 모델 ID(API 사용 시) | 유형 | 컨텍스트 윈도우 | 매개변수 | 설명 |
| - | - | - | - | - | - |
| DeepSeek V4.1-Flash | `deepseek-ai/DeepSeek-V4.1-Flash` | 텍스트, 비전 | 1049k | 16B-552B (활성-전체) | DeepSeek V4.1 Flash는 긴 컨텍스트를 지원하며 코딩, 추론 및 에이전트형 워크로드에 적합한 멀티모달 MoE 모델입니다. |
| DeepSeek V4-Flash-0731 | `deepseek-ai/DeepSeek-V4-Flash-0731` | 텍스트 | 262k | 13B-284B (활성-전체) | DeepSeek V4-Flash-0731은 코딩, 추론, 에이전트형 워크로드에서 뛰어난 성능을 발휘하는 MoE 모델입니다. |
| DeepSeek V4-Pro-0813 | `deepseek-ai/DeepSeek-V4-Pro-0813` | 텍스트 | 1049k | 49B-1.6T (활성-전체) | DeepSeek V4-Pro-0813은 1.6T개의 파라미터를 갖춘 MoE 모델로, 고급 추론, 코딩 및 복잡한 에이전트형 워크로드에서 탁월한 성능을 발휘합니다. |
| DeepSeek V3.1 | `deepseek-ai/DeepSeek-V3.1` | 텍스트 | 161k | 37B-671B (활성-전체) | 프롬프트 템플릿을 통해 사고 모드와 비사고 모드를 모두 지원하는 대규모 하이브리드 모델입니다. |
| Google Gemma 4 31B | `google/gemma-4-31B-it` | 텍스트, 비전 | 262k | 31B (전체) | Gemma 4 31B Dense는 고급 추론과 에이전트형 워크플로, 더 긴 컨텍스트를 지원하도록 설계되었으며, 처음부터 140개 이상의 언어로 트레이닝되었습니다. |
| Google Gemma 4 26B A4B Instruct | `google/gemma-4-26B-A4B-it` | 텍스트, 비전 | 262k | 4B-26B (활성-전체) | Gemma 4 26B A4B는 LoRA를 지원하며, 에이전트형 워크플로를 위한 함수 호출 기능을 제공하는 멀티모달 MoE 모델입니다. |
| IBM Granite 4.2 8B | `ibm-granite/granite-4.2-8b` | 텍스트 | 131k | 8B (전체) | Granite 4.2 8B는 도구 호출, 지시 수행 및 채팅 기능이 향상된 지시 튜닝 모델입니다. |
| Meta Llama 3.3 70B | `meta-llama/Llama-3.3-70B-Instruct` | 텍스트 | 128k | 70B (전체) | 대화형 작업, 상세한 지침 이행, 코딩에 뛰어난 다국어 모델. |
| Meta Llama 3.1 8B | `meta-llama/Llama-3.1-8B-Instruct` | 텍스트 | 131k | 8B (전체) | 다국어 챗봇의 빠른 응답에 최적화된 효율적인 대화형 모델입니다. |
| MiniMax M3 | `MiniMaxAI/MiniMax-M3` | 텍스트, 비전 | 262k | 23B-428B (활성-전체) | MiniMax M3는 코딩과 에이전트형 워크플로에 최적화된 멀티모달 MoE 모델로, 활성 매개변수는 23B개입니다. |
| Moonshot AI Kimi K2.7 Code | `moonshotai/Kimi-K2.7-Code` | 텍스트, 비전 | 262k | 32B-1T (활성-전체) | Kimi K2.7 Code는 장기적인 에이전트형 코딩 및 소프트웨어 엔지니어링 작업에 특화된 MoE 모델로, 전체 매개변수 1T 중 활성 매개변수는 32B입니다. |
| Moonshot AI Kimi K2.6 | `moonshotai/Kimi-K2.6` | 텍스트, 비전 | 262k | 32B-1T (활성-전체) | Kimi K2.6은 총 1조 개의 매개변수 중 320억 개가 활성화되는 멀티모달 전문가 혼합(MoE) 언어 모델입니다. |
| NVIDIA Nemotron 3.5 Lightning | `nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B` | 텍스트 | 262k | 3B-30B (활성-전체) | Nemotron 3.5 Lightning은 금융 서비스, 사이버 보안, 통신, 소매 등 다양한 분야에서 에이전트형 작업을 빠르고 안정적으로 수행하도록 설계된 MoE 모델입니다. |
| NVIDIA Nemotron 3 Ultra | `nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B` | 텍스트 | 262k | 55B-550B (활성-전체) | Nemotron 3 Ultra는 코딩, 심층 연구, 기업 업무 자동화 등 다양한 분야에서 장시간 실행되는 에이전트를 위해 설계된 강력한 MoE 모델입니다. |
| OpenAI GPT OSS 120B | `openai/gpt-oss-120b` | 텍스트 | 131k | 5.1B-117B (활성-전체) | 고급 추론, 에이전트형 작업 및 범용 용도에 맞게 설계된 효율적인 전문가 혼합 모델. |
| OpenAI GPT OSS 20B | `openai/gpt-oss-20b` | 텍스트 | 131k | 3.6B-20B (활성-전체) | OpenAI의 Harmony 응답 형식으로 트레이닝되었으며, 추론 기능을 갖추고 지연 시간이 더 짧은 혼합 전문가 모델. |
| Qwen3.8 27B | `Qwen/Qwen3.8-27B` | 텍스트, 비전 | 262k | 27B (전체) | Qwen3.8-27B는 코딩, 연구, 비전 및 장시간 수행하는 에이전트 작업에 적합한 밀집 멀티모달 모델입니다. |
| Qwen3.6 35B A3B | `Qwen/Qwen3.6-35B-A3B` | 텍스트, 비전 | 262k | 3B-35B (활성-전체) | Qwen3.6-35B-A3B는 262K 컨텍스트를 지원하며 에이전트형 코딩 워크플로에 최적화된 MoE 멀티모달 모델입니다. |
| Z.AI GLM 5.3 Flash | `zai-org/GLM-5.3-Flash` | 텍스트, 비전 | 1049k | 18B-320B (활성-전체) | GLM-5.3-Flash는 총 320B개의 매개변수 중 18B개가 활성화되는 네이티브 멀티모달 모델입니다. |
| Z.AI GLM 5.2 | `zai-org/GLM-5.2` | 텍스트 | 1049k | 40B-744B (활성-전체) | GLM-5.2는 총 7,440억 개의 매개변수 중 400억 개를 활성화하는 전문가 혼합(MoE) 언어 모델입니다. |

<h2 id="experimental-models">
  실험 단계 모델
</h2>

다음 모델은 [실험](/ko/products/inference/serverless/lifecycle#model-lifecycle-stages) 단계입니다.

*현재 없음*

<h2 id="deprecated-models">
  사용 중단된 모델
</h2>

다음 모델은 [사용 중단](/ko/products/inference/serverless/lifecycle#model-lifecycle-stages)되었습니다.

| 모델 | 모델 ID(API 사용 시) | 유형 | 컨텍스트 윈도우 | 매개변수 | 설명 |
| - | - | - | - | - | - |
| DeepSeek V4-Flash | `deepseek-ai/DeepSeek-V4-Flash` | 텍스트 | 1049k | 13B-284B (활성-전체) | DeepSeek V4-Flash는 1M 컨텍스트 길이를 지원하는 MoE 모델로, 코딩, 추론, 에이전트형 워크로드에 적합합니다. |
| DeepSeek V4-Pro | `deepseek-ai/DeepSeek-V4-Pro` | 텍스트 | 1049k | 49B-1.6T (활성-전체) | DeepSeek V4-Pro는 활성 매개변수가 49B인 1.6T 매개변수 MoE 모델로, 고급 추론, 코딩, 복잡한 에이전트형 워크로드에서 뛰어난 성능을 발휘합니다. |
| IBM Granite 4.1 8B | `ibm-granite/granite-4.1-8b` | 텍스트 | 131k | 8B (전체) | Granite 4.1 8B는 향상된 도구 호출, 지시 이행, 채팅 기능을 제공하는 긴 컨텍스트 instruct 모델입니다. |
| JetBrains Mellum2 12B A2.5B | `JetBrains/Mellum2-12B-A2.5B-Instruct` | 텍스트 | 131k | 2.5B-12B (활성-전체) | Mellum2-12B-A2.5B-Instruct는 131K 컨텍스트를 지원하는 빠른 MoE 모델로, 코딩, 도구 사용, 저지연 AI 워크플로를 위해 설계되었습니다. |
| Meta Llama 3.1 70B | `meta-llama/Llama-3.1-70B-Instruct` | 텍스트 | 131k | 70B (전체) | 빠르게 응답하는 다국어 챗봇 상호작용에 최적화된 효율적인 대화형 모델입니다. |
| OpenPipe Qwen3 14B Instruct | `OpenPipe/Qwen3-14B-Instruct` | 텍스트 | 32.8k | 14.8B (전체) | 파인튜닝으로 에이전트를 구축할 수 있도록 OpenPipe가 최적화한 효율적인 다국어 dense 지시 튜닝 모델입니다. |
| Qwen3.6 27B | `Qwen/Qwen3.6-27B` | 텍스트, 비전 | 262k | 27B (전체) | Qwen3.6-27B는 262K 컨텍스트를 지원하는 27B dense 멀티모달 모델로, 플래그십 수준의 에이전트형 코딩을 위해 설계되었습니다. |
| Qwen3.5 35B A3B | `Qwen/Qwen3.5-35B-A3B` | 텍스트, 비전 | 262k | 3B-35B (활성-전체) | Qwen3.5-35B-A3B는 채팅, 추론, 에이전트형 작업 전반에서 효율적인 고처리량 추론을 위해 설계된 오픈 가중치 멀티모달 MoE 모델입니다. |
| Qwen3 30B A3B | `Qwen/Qwen3-30B-A3B-Instruct-2507` | 텍스트 | 262k | 3.3B-30.5B (활성-전체) | Qwen3-30B-A3B-Instruct-2507은 추론, 코딩, 긴 컨텍스트 이해 능력이 향상된 30.5B MoE 지시 튜닝 모델입니다. |

<h2 id="use-model-ids">
  모델 ID 사용하기
</h2>

API를 호출할 때 모델을 지정하려면 앞의 table에 나와 있는 해당 모델의 `Model ID`를 사용하세요. 예를 들면 다음과 같습니다.

```python theme={"system"}
response = client.chat.completions.create(
    model="meta-llama/Llama-3.1-8B-Instruct",
    messages=[...]
)
```

<h2 id="next-steps">
  다음 단계
</h2>

모델을 선택했다면 다음 리소스를 참고하여 계속 진행하세요.

* 각 모델의 [사용 한도 및 가격](/ko/products/inference/serverless/usage-limits)을 확인하세요.
* 모델 사용 방법은 [API 레퍼런스](/ko/products/inference/serverless/api-reference)를 참조하세요.
* [W\&B 플레이그라운드](/ko/products/inference/serverless/ui-guide)에서 모델을 사용해 보세요.


## Related topics

- [사용 가능한 모델](/ko/products/post-training/serverless-training/available-models.md)
