aijobs.net

Staff Engineer, Inference Optimizations

Seattle

USD 191K-239K Senior-level Full Time

Apply Save
Found 16h ago
Tasks
Perks/Benefits
Skills/Tech-stack

AMD GPU | Artificial Intelligence | Attention Mechanisms | Bandwidth Optimization | CUDA | CUDA kernel | Compute Utilization Optimization | Compute utilization | Distributed Systems | FP4 | FP8 | FlashAttention | GPU Programming | High Performance | High-Performance Computing | INT8 | Kernel Fusion | Language Models | Large Language Models | MOE | Memory bandwidth | Memory bandwidth optimization | Mixture of Experts | NVIDIA GPU | OpenAI Triton | OpenAI Triton Compiler | Parallel Computing | Performance Computing | Quantization | RMSNorm | ROCm | TensorRT | Triton | Triton Compiler | Utilization Optimization

Education

N/A

Roles

Engineer | Senior Software Engineer | Software Engineer

Regions

North America

Countries

United States

States

Washington, US

Cities

Seattle, Washington, US

Apply Save
Language: en Views: 0 Clicks: 0 Saves: 0

Related jobs