ML Performance Engineer
Tasks
- Build benchmark suites and regression frameworks
- Collaborate with ML and platform engineering teams to embed best practices
- Document performance tuning playbooks and share findings
- Drive compiler level optimizations using Triton XLA TorchInductor or TVM
- Evaluate new hardware and software and advise adoption
- Identify and eliminate bottlenecks in data loading model compute communication and memory
- Implement and tune quantization sparsity and pruning strategies
- Improve cost efficiency via model architecture hardware selection and scheduling
- Optimize AI training and inference pipelines for throughput latency and cost
- Optimize KV cache continuous batching and speculative decoding for LLM serving
- Optimize data pipelines sharding strategies and storage access patterns
- Optimize distributed training using tensor parallelism pipeline parallelism FSDP and ZeRO sharding
- Stay current with AI systems research and translate advances to production
- Tune attention implementations using FlashAttention and paged attention
Perks/Benefits
Skills/Tech-stack
Benchmarking | C++ | Continuous batching | DeepSpeed | Distributed Training | FSDP | FinOps | FlashAttention | GPU Architecture | HPC | KV cache | Memory Management | Model Parallelism | Paged Attention | Profiling | Pruning | Python | Quantization | Regression testing | Sparsity | Speculative decoding | TVM | TensorRT-LLM | TorchInductor | Triton | VLLM | XLA | Zero
Education
Related jobs
-
Featured Feat. Principal Knowledge & Data Architect USD 174K-284KAWS Neptune | Canonicalization | Chunking | Cypher | DBTBenefits including health and wellness programs | Health, wellness, and retirement plansSenior-level Full TimeHeadquarters - Chevy Chase, MD R15d ago
-
Explosives Research Experiment Lead USD 146K-222KAerospace Engineering | Bench testing | C++ | Computational modeling | Computer Aided Design401k | Education reimbursement | Flexible schedule | Hybrid work schedule | Relocation assistanceSenior-level Full TimeLivermore, CA, United States R1d ago
-
AI Engineer - ICAM USD 146K-197KAccess Management | Agile | Artificial Intelligence | Generative AI | Hugging Face100 percent remote workMid-level Full TimeUSA MD Home Office (MDHOME), United … R1d ago
-
Software Engineer, VP USD 169K-205KAPI Gateway | AWS Lambda | Agile | Amazon Bedrock | Amazon EC2Educational assistance | Health and wellness benefits | Paid Holidays | Paid maternity and parental bonding leave | Paid sick daysExecutive-level Full TimeNew Jersey Office - 210 Hudson … R1d ago
-
Senior-level Full TimeUnited States - Remote R1d ago
-
Senior-level Full TimeUnited States - Remote R1d ago
-
Generative AI Specialist USD 100K-150KAgent systems | Agentic Workflows | Chunking | Deterministic Evaluation | EmbeddingsSenior-level Full TimeUnited States - Remote R1d ago
-
Large Language Model Specialist USD 100K-150KAdapter-Tuning | Attention Optimization | Benchmarking | DPO | DeepSpeed ZeRODirect W2 position | Remote workSenior-level Full TimeTempe, AZ R1d ago
-
Machine Learning Research Engineer USD 100K-150KAblation Studies | Accelerator hardware | Computer Vision | Data Quality | Data quality monitoringSenior-level Full TimeUnited States - Remote R1d ago
-
Senior-level Full TimeUnited States - Remote R1d ago
-
ML Security Engineer USD 100K-150KAccess Controls | Access Management | Adversarial ML | Application Security | AuthorizationSenior-level Full TimeUnited States - Remote R1d ago
-
Hadoop Solutions Developer USD 100K-150KAWS EMR | Airflow | Apache Atlas | Apache Flink | Apache HBaseRemote workSenior-level Full TimeUnited States - Remote R1d ago
-
Machine Learning Engineer USD 80K-90KDeep learning | Evaluation metrics | Generalization | Language Models | Large Language ModelsSenior-level Full TimeFremont, California R1d ago
-
Senior Software Engineer (Storage) - remote in the US USD 100K-150KArgo CD | ArgoCD | Block Storage | CSI | Cluster APISenior-level Full TimeBoston, MA, United States R1d ago
-
Applied AI Lead USD 140K-180KAPI Integration | Agents | Artificial Intelligence | Assistants | Context engineeringEquity package | Health coverage | Remote-first workplace | Unlimited PTOSenior-level Full TimeRemote - United States or Canada R1d ago
-
Principal Applied AI Engineer USD 185K-245KAgent Frameworks | Agent SDK | Anthropic Agent SDK | Context engineering | EvalsSenior-level Full TimeRedesign Health R1d ago
-
AI Forward Deployed Engineer | $120K-$150K + Hybrid + Equity | AI-Based Outage Intelligence Company A USD 120K-150KAI workflows | APIs | Automation | Backend Development | IntegrationDirect impact on company growth | Equity | Hybrid work | Significant ownership | Unlimited PTOMid-level Full TimeKing of Prussia, PA, United States R1d ago
-
API Design | Agentic AI | Cloud Computing | Data Infrastructure | Deployment401k match | Career advancement | Dental insurance | Flexible time off policy | Life insuranceSenior-level Full TimeDallas, Texas, United States; United States R1d ago
-
Machine Learning Research Engineer USD 200K-330KAWS | Azure | Benchmarking | CUDA | DDP401k match | Dental insurance | Health insurance | Paid time off | Vision insuranceMid-level Full TimeEmeryville, California, United States; Hybrid (2-3 … R1d ago
-
Senior HPC and Quantum Systems Engineer USD 272K-431KAPI Integration | Accelerated computing | Amazon Braket | C++ | CUDASenior-level Full TimeUS, MA, Westford R1d ago
-
Staff Engineer, Inference Optimizations USD 191K-239KBF16 | Bandwidth Optimization | CUDA | Expert Routing | FP4Conference reimbursement | Education reimbursement | Employee assistance program | Flexible time off | LinkedIn Learning accessSenior-level Full TimeDenver R1d ago
-
Staff Engineer, Inference Optimizations USD 191K-239KAttention Mechanisms | BF16 | CUDA | CUDA kernels | Distributed SystemsConference reimbursement | Education reimbursement | Employee assistance program | Flexible time off | LinkedIn LearningSenior-level Full TimeBoston R1d ago
-
Staff Engineer, Inference Optimizations USD 191K-239KAMD GPU | Attention Optimization | Bandwidth Optimization | Benchmarking | CUDAConference reimbursement | Employee assistance program | Flexible time off | LinkedIn Learning access | Local Employee MeetupsSenior-level Full TimeAustin R1d ago
-
Staff Engineer, Inference Optimizations USD 191K-239KAttention Optimization | BF16 | CUDA | FP4 | FP8Conference reimbursement | Education reimbursement | Employee assistance program | Employee stock purchase program | Equity compensationSenior-level Full TimeSan Francisco R1d ago
-
Machine Learning Engineer USD 155K-228KAWS | Airflow | Argo CD | Azure | CI/CDGenerous time off | Healthcare | Paid parental leave | Paid personal time off | Paid sick timeMid-level Full TimeRemote - US R1d ago