aijobs.net

Senior Consultant Specialist (Model Hosting/Inference Optimization)

Xi'an, Shaanxi, China R

CNY 160K-192K (estimate) Senior-level Full Time

Apply Save
Found 17h ago
Tasks
Perks/Benefits
Skills/Tech-stack

AWQ | AWS | Accelerate | Azure | CPU architecture | CUDA | Continuous batching | Cost Optimization | Data Preparation | Distributed Training | Docker | Dockerized Deployment | Dynamic batching | FP8 | GPTQ | GPU Architecture | Google Cloud | HPC | Hugging Face | Hugging Face Transformers | Hyperparameter Tuning | INT4) | Inference Optimization | KV cache | Kubernetes | Latency optimization | LoRA | Operator optimization | Python | QLoRA | Quantization | SGLang | TensorRT-LLM | Throughput Optimization | VLLM

Education

Bachelor of Science | Master of Science | PhD

Roles

AI Engineer | Engineer | Hosting Engineer | Model Hosting Engineer | Senior AI Engineer

Regions

Asia/Pacific

Countries

China

States

Shaanxi, CN

Cities

Xi’an, Shaanxi, CN

Apply Save
Language: en Views: 0 Clicks: 0 Saves: 0

Related jobs