Find jobs in AI/ML, Data Science and Big Data
62 results
for Speculative decoding
(Skill/Tech stack)
-
AI Platform Engineer USD 130K-180KAPI Gateway | AWS | Authentication | Authorization | AutoscalingCareer growth | Direct W2 employment | Remote workSenior-level Full TimeUnited States - Remote R2d ago
-
Mid-level Full TimeSan Jose, United States3d ago
-
Senior Inference Engineer, AGI USD 167K-260KAttention Mechanisms | Autoregressive decoding | BF16 | C++ | CUDA401k matching | Health insurance | Paid time off | Parental leaveSenior-level Full TimeSunnyvale, California, USA3d ago
-
Senior Software Engineer USD 151K-235KAuto Scaling | Batch scheduling | C++ | CI/CD | Continuous batchingFlexible work location | Health and wellbeing resources | Paid volunteer daysSenior-level Full TimeSeattle - United States - Seattle, … R3d ago
-
Senior Software Engineer - AI Inference Performance USD 184K-287KBatching | C++ | CUDA | CUDA Graphs | CUDA kernelsSenior-level Full TimeUS, CA, Santa Clara4d ago
-
Distributed Training & Inference Optimization Engineer (LLM) - GPU Optimization Department (GPUOD) JPY 8000K-10800KCUDA | Continuous batching | DeepSpeed | Dynamic batching | FSDPMid-level Full TimeRakuten Crimson House, Japan4d ago
-
AI Infrastructure Engineer - Recommendation & LLM USD 160K-220KAlgorithms | C++ | CUDA | CUDA graph | Computer ArchitectureSenior-level Full TimeSan Jose, California, United States5d ago
-
Senior-level Full TimeBengaluru, KA, India9d ago
-
Senior-level Full TimeBengaluru, KA, India9d ago
-
Senior Solutions Architect, Inference Service Providers USD 184K-287KAgent Design | Cache Management | Custom Inference Kernels | Data Curation | DevOpsSenior-level Full TimeUS, CA, Santa Clara R9d ago
-
AIOps | Agent Orchestration | Agent systems | Arize Phoenix | Braintrust401k matching | Flexible vacation time off | Life insurance | Long-term disability | Paid HolidaysSenior-level Full TimeMilpitas, California, United States of America R9d ago
-
Software Engineer, Inference (AI Data Engineering) USD 135K-175KAuto Scaling | Batch scheduling | C plus plus | CI/CD | ClickHouse401k | Dental insurance | Life insurance | Long-term disability insurance | Medical insuranceEntry-level Full TimePalo Alto, CA R11d ago
-
AI Feedback | Agent systems | Context engineering | Deep learning | DeepSpeedSenior-level Full TimeSingapore, Singapore11d ago
-
C# | C++ | CPU architecture | CUDA | Containerization401k matching | Dental insurance | Life insurance | Long-term disability | Medical insuranceMid-level Full TimeSeattle, Washington, United States11d ago
-
C plus plus | C# | CPU GPU | CPU/GPU profiling | CUDAMid-level Full TimeSan Jose, California, United States11d ago
-
Staff AI Engineer USD 151K-332KC++ | CUDA | CUDA kernel | CUDA kernel development | Cache ManagementHybrid work | In-person work | Remote work | Work-life balance supportSenior-level Full TimeSeattle (WA), United States R12d ago
-
AI Lead Software Architect - SME USD 131K-218KAsynchronous programming | Autogen | C# | CI/CD | CUDASenior-level Full TimeChantilly/Herndon, VA13d ago
-
Senior Inference Engineer, AGI USD 168K-261KAttention | Autoregressive decoding | CUDA | CUDA kernels | Continuous batching401k matching | Dental insurance | Health insurance | Mental health support | Paid time offSenior-level Full TimeSunnyvale, California, USA13d ago
-
Attention Optimization | CUDA | Data Generation | Deep learning | Distributed TrainingSenior-level Full TimeCanada, Toronto13d ago
-
Senior Principal Machine Learning Engineer USD 220K-300KCo-design | Compiler optimization | Context modeling | Data Curation | Deep learningCounseling services | Dental insurance | Employee assistance program | Employee equity | Flexible spending accountSenior-level Full TimeSan Jose, California, United States14d ago
-
ASICs | C++ | CUDA | CUDA Graphs | Continuous batchingRemote workSenior-level Full TimeUnited States (Remote) R16d ago
-
Applied AI Engineer - iCloud Data USD 150K-220KAI Foundry | Apache Flink | Apache Kafka | Azure AI | Azure AI FoundrySenior-level Full TimeCupertino; Seattle17d ago
-
Applied AI Engineer - iCloud Data USD 150K-220KAWS | Agent Frameworks | Agent coordination | Apache Flink | AzureSenior-level Full TimeCupertino; Seattle17d ago
-
Senior Product Manager – AI Inference Performance USD 208K-327KArtificial Intelligence | Benchmarking | Inference Optimization | Inference Server | KV cacheSenior-level Full TimeUS, CA, Santa Clara17d ago
-
Mid-level Full TimeUS - MA - Wilmington17d ago
-
Software Engineer, Applied AI Infrastructure USD 193K-352KAttention | Batching | CI Failure Attribution | Cloud infrastructure | Context handlingSenior-level Full TimeMountain View, California (HQ)18d ago
-
Engineering Manager, ML Performance USD 207K-300KAuto sharding | Auto-tuning | CUDA | CUDA programming | CUDA runtimeSenior-level Full TimeSunnyvale, CA, USA; Kirkland, WA, USA19d ago
-
Senior Machine Learning Engineer USD 188K-282KAB Testing | Adversarial Machine Learning | Calibration monitoring | Canary Releases | Closed LoopSenior-level Full TimePalo Alto, CA19d ago
-
AI Researcher USD 295K-445KCache Compression | Deep learning | Direct Preference Optimization | Experiment design | Fine TuningFast Hiring Response | Immigration support | In person Work Mode | Permission to Publish | Relocation supportSenior-level Full TimeSan Francisco Office20d ago
-
Performance Engineer, Inference INR 4000K-6000KC++ | CUDA | Copy-on-write | Disaggregated Prefill | Disaggregated prefill decodeSenior-level Full TimeBengaluru R20d ago
-
Staff Software Engineer, Inference GBP 116K-155KAutoscaling | BF16 | Benchmarking | C++ | CUDACritical illness cover | Employee assistance programme | Family dental insurance | Family medical insurance | Life assuranceSenior-level Full TimeLondon, England23d ago
-
DL Performance Software Engineer - LLM Inference CAD 135K-185KAlgorithms | Autotuning | C plus plus | CUDA | Computer ArchitectureMid-level Full TimeCanada, Toronto24d ago
-
DPO | Fine Tuning | GRPO | KV cache | LoRAHealth insurance | Remote work flexibility | Startup equitySenior-level Full TimeSingapore25d ago
-
Autoscaling | Batching | Capacity Planning | Disaggregated Prefill | Disaggregated prefill decodeConference allowance | English education program | Equipment stipend | Flu vaccination support | Global buddy programSenior-level Full TimeSeoul, South Korea26d ago
-
AI/ML ASIC Architect USD 163K-235KARM | ASIC architecture | AXI interconnect | Area Optimization | Attention MechanismsSenior-level Full TimeMilpitas, CA, United States26d ago
-
Senior-level Full TimeMilpitas, CA, United States26d ago
-
Senior-level Full TimeIndia, Bengaluru27d ago
-
Algorithm Optimization | Deep learning | GPU Computing | HPC | High PerformanceSenior-level Full TimeIsrael, Tel Aviv27d ago
-
Engineering Manager – AI Engineering BRL 1000KAutoscaling | C++ | CUDA | DeepSpeed | Distributed TrainingMid-level Full TimeBangalore, Karnataka30d ago
-
AWS | Agentic Systems | Azure | CI/CD | Computer VisionSenior-level Full TimeLTA ITSC L4, Singapore30d ago
-
Applied AI Engineer, Inference USD 188K-275KBatching | Benchmarking | CUDA | GPU Utilization | Graph Capture401k employer match | Disability insurance | Employee stock purchase program | Flexible PTO | Flexible spending accountMid-level Full TimeBellevue, WA/ San Francisco, CA/ Sunnyvale, …1mo ago
-
Research Manager | Production Inference GBP 100K-178KAutoscaling | Efficiency Improvements | Hardware utilization | Inference Optimization | LLM InferenceAnnual leave | Flexible hours | Hybrid work | In-person team events | Mental health resourcesMid-level Full TimeLondon1mo ago
-
Amazon SageMaker | Autoscaling | Capacity Planning | Cause analysis | Cloud infrastructureSenior-level Full TimeGLASGOW, LANARKSHIRE, United Kingdom1mo ago
-
AI Researcher - Efficient AI (Contractor) USD 90K-114KAgent systems | Cache Compression | DPO | Distillation | Hybrid Attention401k matching | Fitness Goal Incentives | Health, dental, vision insurance | Hybrid work | Life and disability insuranceEntry-level ContractSanta Clara, CA R1mo ago
-
NLP Performance Engineer GBP 100K-140KBenchmarking | CUDA | KV cache | LLM Inference | Language ModelsAnnual leave | Barista service | Company pension | Cycle to work scheme | HealthcareMid-level Full TimeLondon, United Kingdom1mo ago
-
CUDA | Cache Compression | Co Optimization | Decoding algorithms | Evaluation methodology401k plan | Career growth and learning opportunities | Collaborative culture | Disability insurance | Flexible work arrangementsSenior-level Full TimePalo Alto, California, United States1mo ago
-
Machine Learning Engineer — Inference Optimization USD 170K-287KBF16 | CUDA | Deep learning | Distributed Systems | FP16Senior-level Full TimeRemote (world) R1mo ago
-
Senior Inference Runtime Engineer TWD 1900K-2500KCUDA | CUDA profiling | Continuous batching | Distributed inference | GPU Memory OptimizationFlexible work culture | Inclusive environment | Training and mentoringSenior-level Full TimeSingapore, SG / Penang, MY / …1mo ago
-
AI Inference Engineer GBP 80K-106KAutoscaling | Batching | CUDA | Cache Management | Capacity PlanningBiannual bonus | Breakfast allowance | Dinner allowance | Equity sign-on bonus | Expensed technologyMid-level Full TimeLondon, England, United Kingdom - Remote R1mo ago
-
Senior Software Engineer I, Inference USD 139K-204KAdaptive scheduling | Autoscaling | BF16 | C++ | CI/CD401k match | Dental insurance | Disability insurance | Employee stock purchase program | Flexible PTOSenior-level Full TimeSunnyvale, CA / Bellevue, WA1mo ago