Skip to content
View dnwlwlq123's full-sized avatar

Block or report dnwlwlq123

Block user

Prevent this user from interacting with your repositories and sending you notifications. Learn more about blocking users.

You must be logged in to block users.

Maximum 250 characters. Please donโ€™t include any personal information such as legal names or email addresses. Markdown is supported. This note will only be visible to you.
Report abuse

Contact GitHub support about this userโ€™s behavior. Learn more about reporting abuse.

Report abuse
dnwlwlq123/README.md

header

Email GitHub


๐Ÿ‘‹ About Me

LLM ์„œ๋น™ ์ธํ”„๋ผ์™€ Korean ASR ๋„๋ฉ”์ธ์˜ ์—”์ง€๋‹ˆ์–ด์ž…๋‹ˆ๋‹ค.

์ฝœ๋ด‡/AICC ํ™˜๊ฒฝ์—์„œ vLLM ๊ธฐ๋ฐ˜ ์ถ”๋ก  ์„œ๋น™ ์ตœ์ ํ™”์™€ ESPnet/NeMo/Whisper ๊ธฐ๋ฐ˜ ํ•œ๊ตญ์–ด ์Œ์„ฑ ์ธ์‹ ๋ชจ๋ธ ํŒŒ์ธํŠœ๋‹์„ ๋‹ค๋ฃน๋‹ˆ๋‹ค.

์ถ”์ธก๋ณด๋‹ค ์‹ค์ธก ๋ฒค์น˜๋งˆํฌ, ํ™”๋ คํ•œ ์ŠคํŽ™๋ณด๋‹ค ์šด์˜ ์•ˆ์ •์„ฑ์„ ์šฐ์„ ํ•ฉ๋‹ˆ๋‹ค.


๐ŸŽฏ What I Do

LLM Inference Serving

ํ”„๋กœ๋•์…˜ ํ™˜๊ฒฝ์—์„œ ์ˆ˜์‹ญ ์ฑ„๋„ ๋™์‹œ ์ฒ˜๋ฆฌ๋ฅผ ๊ฒฌ๋””๋Š” LLM ์„œ๋น™ ์Šคํƒ์„ ์„ค๊ณ„ํ•˜๊ณ  ์ตœ์ ํ™”ํ•ฉ๋‹ˆ๋‹ค. attention backend ์„ ํƒ, KV cache ์–‘์žํ™”, MoE ๋ผ์šฐํŒ…, speculative decoding ๊ฐ™์€ ์ถ”๋ก  ๋ ˆ์ด์–ด ์ „๋ฐ˜์„ ์ง์ ‘ ๊ฒ€์ฆํ•ด TTFT99 / ITL99 / Throughput ํŠธ๋ ˆ์ด๋“œ์˜คํ”„ ๋“ฑ๋“ฑ ์‹ค์ธก ๊ธฐ๋ฐ˜์œผ๋กœ ๊ฒฐ์ •ํ•ฉ๋‹ˆ๋‹ค.

Kernel-Level Diagnosis

vLLM ํŒŒ์ดํ”„๋ผ์ธ์€ ํ•œ ๋ ˆ์ด์–ด๋งŒ ๋ด์„œ๋Š” ๋ณ‘๋ชฉ์ด ์•ˆ ์žกํž™๋‹ˆ๋‹ค. attention kernel ยท MoE kernel ยท quantization ยท CUDA graph ยท prefix caching์ด ์„œ๋กœ ์–ฝํ˜€ ์žˆ์–ด, ๋ชจ๋ธ ๊ตฌ์กฐ (head_dim, sliding window, MoE expert ์ˆ˜) ์™€ GPU ์•„ํ‚คํ…์ฒ˜ (SM ๋ฒ„์ „, Tensor Core ์ง€์›) ๋ฅผ ํ•จ๊ป˜ ๋ด์•ผ ํ•ฉ๋‹ˆ๋‹ค. ์ด ํŒŒ์ดํ”„๋ผ์ธ ์ „์ฒด๋ฅผ ๋”ฐ๋ผ๊ฐ€๋ฉฐ ์–ด๋””์„œ fallback์ด ๋ฐœ์ƒํ•˜๋Š”์ง€, ์–ด๋–ค kernel์ด ํ˜ธ์ถœ๋˜๋Š”์ง€ ์ถ”์ ํ•ด ๋ฌธ์ œ๋ฅผ ์ขํ˜€๋ƒ…๋‹ˆ๋‹ค.

Korean ASR

์ฝœ์„ผํ„ฐ 8kHz ๋„๋ฉ”์ธ ์œ„์ฃผ๋กœ ํ•œ๊ตญ์–ด ASR ๋ชจ๋ธ ํŒŒ์ธํŠœ๋‹๊ณผ ์„œ๋น™ ํŒŒ์ดํ”„๋ผ์ธ์„ ๊ตฌ์ถ•ํ•ฉ๋‹ˆ๋‹ค. ESPnet contextual block transformer, NeMo Nemotron, Whisper ๋ผ์ธ์„ ๋‹ค๋ฃจ๋ฉฐ, ๋…ธ์ด์ฆˆ ํ† ํฐ ์ฒ˜๋ฆฌยท์ปค์Šคํ…€ vocabยทVAD ๊ธฐ๋ฐ˜ EPD ๊ฐ™์€ ๋„๋ฉ”์ธ ํŠนํ™” ์ด์Šˆ๋ฅผ ํ•ด๊ฒฐํ•ฉ๋‹ˆ๋‹ค.

Production Deployment

Kubernetes / ArgoCD / Helm ๊ธฐ๋ฐ˜ GitOps ํŒŒ์ดํ”„๋ผ์ธ์œผ๋กœ ์˜จํ”„๋ ˆ๋ฏธ์Šค๋ถ€ํ„ฐ ํด๋ผ์šฐ๋“œ GPU๊นŒ์ง€ ๋ฉ€ํ‹ฐ ํ™˜๊ฒฝ ๋ฐฐํฌ๋ฅผ ์šด์˜ํ•ฉ๋‹ˆ๋‹ค.


๐Ÿ› ๏ธ Technical Skills

LLM Inference & Optimization

  • Serving Engine: vLLM, SGLang, TensorRT-LLM
  • Attention Backend: FlashAttention 2/3/4, FlashInfer, Triton, CUTLASS
  • Quantization: FP8 (block / dynamic / runtime), INT8, INT4, AWQ
  • KV Cache: BF16 / FP8 / paged attention, prefix caching
  • Adapter: Multi-LoRA hot-swap, dummy adapter, runtime quantization + LoRA
  • Speculative Decoding: EAGLE3, draft model ๊ฒ€์ฆ
  • Structured Output: response_format, guided decoding

GPU Kernel & Low-Level Stack

  • Attention Kernel: FA2/FA3/FA4 ์ฐจ์ด (MLA prefill, paged KV, head_dim ํ˜ธํ™˜์„ฑ), FlashInfer CUTLASS ๊ฒฝ๋กœ, Triton fallback ์กฐ๊ฑด
  • MoE Kernel: CUTLASS MoE FP8, Triton MoE fallback, fused routing, GDN (Gated Delta Net) prefill ์ œ์•ฝ
  • Quantization Kernel: FP8 W8A8, FP8 block-wise, K/V scale ๋กœ๋”ฉ, runtime quant + LoRA ํ˜ธํ™˜์„ฑ
  • CUDA Graph: piecewise / full capture, enforce-eager, LoRA + CUDA graph ์ถฉ๋Œ ํŒจํ„ด
  • Memory Layout: paged attention block size, KV cache ๋ถ„๋ฐฐ, sliding window ์˜ํ–ฅ
  • Compatibility ์ง„๋‹จ: SM ๋ฒ„์ „ โ†” kernel ์ง€์› ๋งคํŠธ๋ฆญ์Šค, driver / CUDA / PyTorch / vLLM ๋ฒ„์ „ ํ˜ธํ™˜์„ฑ ์ถ”์ 
  • Diagnosis Tools: nvidia-smi, nsys ํ”„๋กœํŒŒ์ผ๋ง, vLLM ๋‚ด๋ถ€ ๋กœ๊ทธ (backend selection / fallback warning)

ASR & Speech

  • Frameworks: ESPnet, NVIDIA NeMo, HuggingFace Transformers
  • Models: Conformer, Contextual Block Transformer, Nemotron, Whisper
  • Tooling: Faster-Whisper, CTranslate2, Silero VAD
  • Domain Skills: 8kHz ์ฝœ์„ผํ„ฐ ๋ฐ์ดํ„ฐ ์ฒ˜๋ฆฌ, custom vocab/CTC ์žฌ์ดˆ๊ธฐํ™”, ITN/TN, BPE vs char ๋ชจ๋ธ ๋น„๊ต
  • Training: 4-stage curriculum ํŒŒ์ธํŠœ๋‹, ๋ถ„์‚ฐ ํ•™์Šต (multi-GPU), shard manifest ๊ธฐ๋ฐ˜ ๋Œ€์šฉ๋Ÿ‰ ๋ฐ์ดํ„ฐ ๋กœ๋”ฉ

Infra & DevOps

  • Orchestration: Kubernetes, ArgoCD, Helm
  • CI/CD: Jenkins, GitLab CI
  • Container: Docker
  • Cloud / GPU: ์˜จํ”„๋ ˆ๋ฏธ์Šค, RunPod, Elice Cloud
  • GPU Architecture: NVIDIA H100 (SM90), B200 (SM100), RTX PRO 6000 Blackwell (SM120)
  • CUDA Stack: CUDA 12.x, driver 535/570+, NCCL, NVIDIA MPS

Backend & General

  • Languages: Python, Java, Bash
  • Backend: FastAPI, Spring Boot
  • Database: PostgreSQL, MySQL, VectorDB
  • Protocol: WebSocket, REST API (OpenAI-compatible)

๐Ÿงฐ Stack

Category Stack
Inference vLLM FlashAttention FlashInfer TensorRT-LLM CUTLASS Triton CUDA
ML / DL PyTorch HuggingFace NeMo ESPnet CTranslate2
Languages Python Java Bash
Backend FastAPI Spring Boot PostgreSQL
DevOps Kubernetes ArgoCD Helm Docker Jenkins

๐Ÿ“ซ Contact

์ž‘์—… ๊ด€๋ จ ๋ฌธ์˜๋‚˜ ์ด์Šˆ๋Š” Email ๋˜๋Š” GitHub Issue๋กœ ๋ถ€ํƒ๋“œ๋ฆฝ๋‹ˆ๋‹ค.

Popular repositories Loading

  1. web_workspace web_workspace Public

    Java

  2. java_workspace java_workspace Public

    JavaScript

  3. spring_workspace spring_workspace Public

    JavaScript

  4. NCPTestMaven NCPTestMaven Public

    Java

  5. SpringNCPMaven SpringNCPMaven Public

    Java

  6. Studi Studi Public

    Forked from JungYeon22/Studi_tmp

    Java