aijobs.net

Senior Machine Learning Engineer, LLM Inference Optimization

Palo Alto, California, United States

USD 195K-262K Senior-level Full Time

Apply Save
Found 11h ago
Tasks
Perks/Benefits
Skills/Tech-stack

AWQ | Benchmarking | CUDA | CUDA kernels | Chunked prefill | Continuous batching | Disaggregated Prefill | Disaggregated prefill decode | FP4 | FP8 | GPTQ | INT4) | INT8 | Inference Server | KServe | KV cache | Knowledge Distillation | LLM | Latency optimization | Nvidia Dynamo | Prefill Decode | Prefix caching | PyTorch | Python | Quantization | Quantization aware training | Ray Serve | SGLang | SmoothQuant | Speculative decoding | TensorRT-LLM | Throughput Optimization | Transformer | Triton | Triton Inference | Triton Inference Server | VLLM | VLM

Education

N/A

Roles

Engineer | Learning Engineer | Machine Learning Engineer | Senior Machine Learning Engineer

Regions

North America

Countries

United States

States

California, US

Cities

Palo Alto, California, US

Apply Save
Language: en Views: 0 Clicks: 0 Saves: 0

Related jobs