aijobs.net

Sr. Inference Optimization Engineer (local / edge runtime)

USA - CA - Santa Clara, United States

USD 195K-361K Senior-level Full Time

Apply Save
Found 9d ago
Tasks
Perks/Benefits
Skills/Tech-stack

AWQ | Batching | Build systems | C++ | CPU Kernels | CUDA | Decoding | GPTQ | GPU Programming | Ggml | Gguf | KV cache | LLM Inference | Latency optimization | Linux | Llama.cpp | Low Level Debugging | Memory Optimization | OneAPI | Profiling | Python | Quantization | SIMD | SYCL | Scheduling | Throughput Optimization | VLLM | Vulkan

Education

Bachelor of Science | Master of Science

Roles

Engineer | Inference Optimization Engineer | Optimization Engineer

Regions

North America

Countries

United States

States

California, US

Cities

Santa Clara, California, US

Apply Save
Language: en Views: 2 Clicks: 0 Saves: 0

Related jobs