LLM ์๋น ์ธํ๋ผ์ Korean ASR ๋๋ฉ์ธ์ ์์ง๋์ด์ ๋๋ค.
์ฝ๋ด/AICC ํ๊ฒฝ์์ vLLM ๊ธฐ๋ฐ ์ถ๋ก ์๋น ์ต์ ํ์ ESPnet/NeMo/Whisper ๊ธฐ๋ฐ ํ๊ตญ์ด ์์ฑ ์ธ์ ๋ชจ๋ธ ํ์ธํ๋์ ๋ค๋ฃน๋๋ค.
์ถ์ธก๋ณด๋ค ์ค์ธก ๋ฒค์น๋งํฌ, ํ๋ คํ ์คํ๋ณด๋ค ์ด์ ์์ ์ฑ์ ์ฐ์ ํฉ๋๋ค.
ํ๋ก๋์ ํ๊ฒฝ์์ ์์ญ ์ฑ๋ ๋์ ์ฒ๋ฆฌ๋ฅผ ๊ฒฌ๋๋ LLM ์๋น ์คํ์ ์ค๊ณํ๊ณ ์ต์ ํํฉ๋๋ค. attention backend ์ ํ, KV cache ์์ํ, MoE ๋ผ์ฐํ , speculative decoding ๊ฐ์ ์ถ๋ก ๋ ์ด์ด ์ ๋ฐ์ ์ง์ ๊ฒ์ฆํด TTFT99 / ITL99 / Throughput ํธ๋ ์ด๋์คํ ๋ฑ๋ฑ ์ค์ธก ๊ธฐ๋ฐ์ผ๋ก ๊ฒฐ์ ํฉ๋๋ค.
vLLM ํ์ดํ๋ผ์ธ์ ํ ๋ ์ด์ด๋ง ๋ด์๋ ๋ณ๋ชฉ์ด ์ ์กํ๋๋ค. attention kernel ยท MoE kernel ยท quantization ยท CUDA graph ยท prefix caching์ด ์๋ก ์ฝํ ์์ด, ๋ชจ๋ธ ๊ตฌ์กฐ (head_dim, sliding window, MoE expert ์) ์ GPU ์ํคํ ์ฒ (SM ๋ฒ์ , Tensor Core ์ง์) ๋ฅผ ํจ๊ป ๋ด์ผ ํฉ๋๋ค. ์ด ํ์ดํ๋ผ์ธ ์ ์ฒด๋ฅผ ๋ฐ๋ผ๊ฐ๋ฉฐ ์ด๋์ fallback์ด ๋ฐ์ํ๋์ง, ์ด๋ค kernel์ด ํธ์ถ๋๋์ง ์ถ์ ํด ๋ฌธ์ ๋ฅผ ์ขํ๋ ๋๋ค.
์ฝ์ผํฐ 8kHz ๋๋ฉ์ธ ์์ฃผ๋ก ํ๊ตญ์ด ASR ๋ชจ๋ธ ํ์ธํ๋๊ณผ ์๋น ํ์ดํ๋ผ์ธ์ ๊ตฌ์ถํฉ๋๋ค. ESPnet contextual block transformer, NeMo Nemotron, Whisper ๋ผ์ธ์ ๋ค๋ฃจ๋ฉฐ, ๋ ธ์ด์ฆ ํ ํฐ ์ฒ๋ฆฌยท์ปค์คํ vocabยทVAD ๊ธฐ๋ฐ EPD ๊ฐ์ ๋๋ฉ์ธ ํนํ ์ด์๋ฅผ ํด๊ฒฐํฉ๋๋ค.
Kubernetes / ArgoCD / Helm ๊ธฐ๋ฐ GitOps ํ์ดํ๋ผ์ธ์ผ๋ก ์จํ๋ ๋ฏธ์ค๋ถํฐ ํด๋ผ์ฐ๋ GPU๊น์ง ๋ฉํฐ ํ๊ฒฝ ๋ฐฐํฌ๋ฅผ ์ด์ํฉ๋๋ค.
- Serving Engine: vLLM, SGLang, TensorRT-LLM
- Attention Backend: FlashAttention 2/3/4, FlashInfer, Triton, CUTLASS
- Quantization: FP8 (block / dynamic / runtime), INT8, INT4, AWQ
- KV Cache: BF16 / FP8 / paged attention, prefix caching
- Adapter: Multi-LoRA hot-swap, dummy adapter, runtime quantization + LoRA
- Speculative Decoding: EAGLE3, draft model ๊ฒ์ฆ
- Structured Output: response_format, guided decoding
- Attention Kernel: FA2/FA3/FA4 ์ฐจ์ด (MLA prefill, paged KV, head_dim ํธํ์ฑ), FlashInfer CUTLASS ๊ฒฝ๋ก, Triton fallback ์กฐ๊ฑด
- MoE Kernel: CUTLASS MoE FP8, Triton MoE fallback, fused routing, GDN (Gated Delta Net) prefill ์ ์ฝ
- Quantization Kernel: FP8 W8A8, FP8 block-wise, K/V scale ๋ก๋ฉ, runtime quant + LoRA ํธํ์ฑ
- CUDA Graph: piecewise / full capture,
enforce-eager, LoRA + CUDA graph ์ถฉ๋ ํจํด - Memory Layout: paged attention block size, KV cache ๋ถ๋ฐฐ, sliding window ์ํฅ
- Compatibility ์ง๋จ: SM ๋ฒ์ โ kernel ์ง์ ๋งคํธ๋ฆญ์ค, driver / CUDA / PyTorch / vLLM ๋ฒ์ ํธํ์ฑ ์ถ์
- Diagnosis Tools:
nvidia-smi,nsysํ๋กํ์ผ๋ง, vLLM ๋ด๋ถ ๋ก๊ทธ (backend selection / fallback warning)
- Frameworks: ESPnet, NVIDIA NeMo, HuggingFace Transformers
- Models: Conformer, Contextual Block Transformer, Nemotron, Whisper
- Tooling: Faster-Whisper, CTranslate2, Silero VAD
- Domain Skills: 8kHz ์ฝ์ผํฐ ๋ฐ์ดํฐ ์ฒ๋ฆฌ, custom vocab/CTC ์ฌ์ด๊ธฐํ, ITN/TN, BPE vs char ๋ชจ๋ธ ๋น๊ต
- Training: 4-stage curriculum ํ์ธํ๋, ๋ถ์ฐ ํ์ต (multi-GPU), shard manifest ๊ธฐ๋ฐ ๋์ฉ๋ ๋ฐ์ดํฐ ๋ก๋ฉ
- Orchestration: Kubernetes, ArgoCD, Helm
- CI/CD: Jenkins, GitLab CI
- Container: Docker
- Cloud / GPU: ์จํ๋ ๋ฏธ์ค, RunPod, Elice Cloud
- GPU Architecture: NVIDIA H100 (SM90), B200 (SM100), RTX PRO 6000 Blackwell (SM120)
- CUDA Stack: CUDA 12.x, driver 535/570+, NCCL, NVIDIA MPS
- Languages: Python, Java, Bash
- Backend: FastAPI, Spring Boot
- Database: PostgreSQL, MySQL, VectorDB
- Protocol: WebSocket, REST API (OpenAI-compatible)
| Category | Stack |
|---|---|
| Inference | |
| ML / DL | |
| Languages | |
| Backend | |
| DevOps |
- Email: dnwlwlq123@naver.com
- GitHub: @dnwlwlq123
์์ ๊ด๋ จ ๋ฌธ์๋ ์ด์๋ Email ๋๋ GitHub Issue๋ก ๋ถํ๋๋ฆฝ๋๋ค.
