aijobs.net

Senior Applied Scientist, Efficient LLM Inference & Model Optimization

Palo Alto, California, United States

USD 195K-262K Senior-level Full Time

Apply Save
Found 11h ago
Tasks
Perks/Benefits
Skills/Tech-stack

CUDA | Cache Compression | Co Optimization | Decoding algorithms | Evaluation methodology | KV Cache Compression | KV cache | Knowledge Distillation | Kv cache reuse | Language Models | Large Language Models | Latency optimization | Long Context | Long context inference | Machine Learning | Mixture of Experts | Model Compression | Model Runtime | Model Runtime Co Optimization | Numerical Stability | PyTorch | Python | Quantization | Quantization aware training | Speculative decoding | Statistical Reasoning | Tail Latency | Transformer Inference | Triton | Vision Language Models | Vision-language

Education

PhD

Roles

Applied Scientist | Scientist | Senior Applied Scientist

Regions

North America

Countries

United States

States

California, US

Cities

Palo Alto, California, US

Apply Save
Language: en Views: 0 Clicks: 0 Saves: 0

Related jobs