한눈에 보는 전체 파이프라인
클릭 시 더 자세한 정보를 제공해드리겠습니다.
ESC 키 또는 좌측 상단 ← 버튼으로 맵으로 돌아올 수 있습니다
PAI-EasyDistill부터 AI Gateway까지 — 데이터 주권을 보장하는 엔드투엔드 풀스택
클릭 시 더 자세한 정보를 제공해드리겠습니다.
ESC 키 또는 좌측 상단 ← 버튼으로 맵으로 돌아올 수 있습니다
Distillation 그 이상 — 프로덕션 운영까지 고려한 플랫폼 수준의 차별점입니다.
Alibaba Cloud는 목적과 복잡도에 따라 두 가지 distillation / fine-tuning 경로를 제공합니다.
EMNLP 2025 Demos에 발표된 Alibaba 자체 프레임워크 기반. PAI Model Gallery 내 no-code one-click 기능으로 제공됩니다.
방식: Black-box distillation (generative data augmentation)
| 기법 | 지원 | 비고 |
|---|---|---|
| Black-box distillation | ✅ | Teacher가 데이터 생성 |
| SFT (Supervised Fine-Tuning) | ✅ | Student 학습 방식 |
| LoRA | ✅ | 권장 — 품질과 GPU 메모리 균형 |
| QLoRA | ✅ | 메모리 추가 절약 |
| Full-parameter fine-tuning | ✅ | 최고 품질, 리소스 집약 |
| DPO / RLHF / PPO | ❌ | 미지원 |
| White-box (logit-based) | ❌ | 미지원 |
| 옵션 | 설명 | 대상 |
|---|---|---|
| Instruction enhancement | 지시문 다양화, 스타일 확장 | 범용 instruction 모델 |
| Instruction optimization | 지시문 명확화, 상세화 | 범용 instruction 모델 |
| CoT expansion | 추론 단계 상세화 | 추론 모델 |
| CoT abbreviation | 추론 체인 간결화 (추론 속도 ↑) | 추론 모델 |
💡 첫 실행은 augmentation 없이 baseline 수립 후 점진적 적용 권장
| 파라미터 | 기본값 | 비고 |
|---|---|---|
| temperature | 0.8 | [0, 2], 높을수록 다양성 증가 |
| max_new_tokens | 128 | 상세 추론 시 512/1024 권장 |
| learning_rate | 5e-5 | loss 감소 속도에 따라 조정 |
| num_train_epochs | 1 | 1-3 권장, 과적합 주의 |
| seq_length | 128 | 긴 텍스트 시 증가, 메모리 유의 |
별도 경로, Singapore 리전 전용 SFT-only 경량 파이프라인.
| 모델 | 학습 비용 ($/1K tokens) |
|---|---|
| Qwen3-32B | $0.008 |
| Qwen3-14B | $0.0016 |
| Qwen3-VL-8B-Instruct | $0.002 |
| Qwen3-VL-8B-Thinking | $0.002 |
| 구분 | PAI Distillation | Model Studio Fine-tuning |
|---|---|---|
| 목적 | Knowledge transfer (대→소) | Task adaptation |
| Teacher 모델 | ✅ 데이터 생성 | ❌ 직접 제공 |
| Data augmentation | ✅ 내장 | ❌ |
| 모델 선택 | Gallery distillation 지원 모델 | Qwen3-32B/14B/VL-8B |
| 배포 | PAI-EAS | Model Studio Deployment |
| 복잡도 | 높음 (2단계) | 낮음 (업로드→학습→배포) |
PAI-EAS (Elastic Algorithm Service) — 프로덕션 모델 서빙 플랫폼. Distilled / fine-tuned 모델을 라이브 API 엔드포인트로 배포합니다.
| 기능 | 상세 |
|---|---|
| 배포 엔진 | vLLM, TensorFlow Serving, Triton, custom image, ComfyUI, SDWebUI |
| API 형식 | v1/chat/completions (OpenAI 호환) |
| Public endpoint | 기본 공유 게이트웨이, 인터넷 접근 |
| VPC endpoint | 동일 리전 private 접근 (cross-region 미지원) |
| Dedicated gateway | 프로덕션 권장, 강력한 격리와 용량 |
| Autoscaling | ✅ 문서화됨 |
| Async inference | ✅ |
| Observability | Logging, monitoring, alerting 내장 |
| Release management | Blue-green / canary (암시적) |
| Stress testing | 내장 디버깅 및 부하 테스트 |
| Sandbox | 격리 테스트 환경 |
모델 무관 API 게이트웨이. 모든 LLM 백엔드 앞에 위치하여 라우팅, 보안, 관찰 가능성을 단일 프록시 레이어로 제공합니다.
지원 백엔드: Model Studio · PAI-EAS · Self-hosted · 모든 OpenAI 호환 엔드포인트
Alibaba Cloud는 inference 지역을 명시적으로 선택합니다. Transient data는 저장되지 않으며, 모든 전송은 암호화됩니다.
| 구분 | 제어 대상 |
|---|---|
| Region | 접근 포인트 + 데이터 저장 위치. 정적 데이터 항상 여기 유지 |
| Deployment scope | 실제 inference 실행 위치 (compute 노드) |
| Access host | SLA 티어, timeout, 프로토콜, 용량 |
| 리전 | Scope | 보장 |
|---|---|---|
| Singapore | International (중국 본토 제외) | 중국 본토 미경유 |
| Tokyo | Japan | Inference 일본 내 제한 |
| Frankfurt | EU | Inference EU 내 제한 |
| US Virginia | United States | Inference US 내 제한 |
| Hong Kong | China HK | Inference HK 내 제한 |
| Beijing | 중국 본토 | Inference 중국 내 제한 |
| Host | Timeout | 프로토콜 | SLA | 용도 |
|---|---|---|---|---|
| Workspace-specific | 3600s | HTTP/SSE/WS/WebRTC | 99.9% | 프로덕션 |
| DashScope legacy | 600s | HTTP/SSE/WS | 99.9% | 일반/레거시 |
| Trial | 600s | HTTP/SSE | — | 단기 평가 |
* 아래 가격은 Enterprise discount 적용 전 기준입니다.