Find jobs in AI/ML, Data Science and Big Data
77 results
for KV cache
(Skill/Tech stack)
-
Senior AI Engineer - Services Special Projects USD 150K-260KAdversarial evaluation | Airflow | CI/CD | Cloud Platforms | Content ModerationSenior-level Full TimeSan Francisco Bay Area1d ago
-
ML Software Engineer USD 175K-312KAsynchronous programming | Batching | C++ | Concurrency | Distributed SystemsObservability tooling | On-call support | Production incident root cause supportEntry-level Full TimeSeattle2d ago
-
Applied AI Engineer, Inference USD 188K-275KBatching | Benchmarking | CUDA | GPU Utilization | Graph Capture401k employer match | Disability insurance | Employee stock purchase program | Flexible PTO | Flexible spending accountMid-level Full TimeBellevue, WA/ San Francisco, CA/ Sunnyvale, …2d ago
-
AWS | Apache Kafka | Batching | C++ | CassandraSenior-level Full TimeCupertino3d ago
-
多模态交互算法工程师-X-Lab CNY 240K-480KAttention | Checkpointing | Hard Negative Mining | KV cache | Knowledge DistillationSenior-level Full Time上海、深圳4d ago
-
Staff/Principal DevOps Engineer, AI Inference USD 192K-272KAWS IAM | AWS S3 | Amazon EC2 | Amazon EKS | Amazon VPCCommuter benefits | Company Subsidized Lunch Program | Company holidays | Dental insurance | Educational assistanceSenior-level Full TimeCambridge, MA USA4d ago
-
AI Feedback | Context engineering | Data Curation | Deep learning | DeepSpeedSenior-level Full TimeSingapore, Singapore5d ago
-
Analytical modeling | Attention | Batching | Cost modeling | Data AnalysisSenior-level Full TimeSeoul HQ6d ago
-
Senior-level Full TimeWestford, MA R6d ago
-
Senior-level Full TimeSeattle (WA), United States6d ago
-
Senior-level Full TimeUnited States - Remote R6d ago
-
ML Performance Engineer USD 100K-150KBenchmarking | C++ | Compiler optimization | Continuous batching | Custom KernelRemote workSenior-level Full TimeScottsdale, AZ R6d ago
-
AI Researcher - Efficient AI (Contractor) USD 90K-114KAgent systems | Cache Compression | DPO | Distillation | Hybrid Attention401k matching | Fitness Goal Incentives | Health, dental, vision insurance | Hybrid work | Life and disability insuranceEntry-level ContractSanta Clara, CA R8d ago
-
Machine Learning Engineer, AI Labs TWD 1300K-2000KAccuracy evaluation | Cache optimization | Deep learning | Distributed Systems | Inference OptimizationSenior-level Full TimeTaipei, Taiwan9d ago
-
AWQ | Batching | Build systems | C++ | CPU KernelsHybrid work model | On site and off site workSenior-level Full TimeUSA - CA - Santa Clara, …9d ago
-
Senior Engineer, Inference Data Plane USD 139K-174KAutoscaling | Continuous batching | Data parallelism | GRPC | GoEmployee assistance program | Flexible time off | Hybrid work model | LinkedIn Learning access | Local Employee MeetupsSenior-level Full TimeSeattle9d ago
-
Senior Software Engineer I - AI Inference Data Plane USD 139K-174KAutoscaling | Continuous batching | Data parallelism | Distributed Systems | GRPCConference reimbursement | Education reimbursement | Employee assistance program | Employee stock purchase program | Equity compensationSenior-level Full TimeAustin R9d ago
-
Senior Engineer, Inference Data Plane USD 139K-174KContinuous batching | Data parallelism | Distributed Systems | GRPC | GoEmployee assistance program | Employee stock purchase program | Equity compensation | Flexible time off | LinkedIn Learning accessSenior-level Full TimeDenver R9d ago
-
Senior Engineer, Inference Data Plane USD 139K-174KContinuous batching | Data parallelism | Distributed Systems | GRPC | GoConference reimbursement | Employee assistance program | Employee stock purchase program | Equity compensation | Flexible time offSenior-level Full TimeBoston R9d ago
-
Senior Software Engineer I - AI Inference Data Plane USD 139K-174KAutoscaling | Continuous batching | Data parallelism | Distributed Systems | GRPCConference reimbursement | Employee assistance program | Employee stock purchase program | Equity compensation | Flexible time offSenior-level Full TimeSan Francisco R9d ago
-
ASIC Architect, Principal (AI Inference) USD 200K-300KAI accelerator | AI accelerator design | ASIC architecture | Accelerator design | Attention Mechanisms401k with company matching | Company paid life and disability coverage | Company paid medical dental and vision insurance | Company provided computer and home office setup | Paid Company HolidaysSenior-level Full TimeRemote (United States); Canada R10d ago
-
NLP Performance Engineer GBP 100K-140KBenchmarking | CUDA | KV cache | LLM Inference | Language ModelsAnnual leave | Barista service | Company pension | Cycle to work scheme | HealthcareMid-level Full TimeLondon, United Kingdom10d ago
-
AWQ | Benchmarking | CUDA | CUDA kernels | Chunked prefill401k match | Career growth | Collaborative culture | Disability insurance | FlexibilitySenior-level Full TimePalo Alto, California, United States10d ago
-
CUDA | Cache Compression | Co Optimization | Decoding algorithms | Evaluation methodology401k plan | Career growth and learning opportunities | Collaborative culture | Disability insurance | Flexible work arrangementsSenior-level Full TimePalo Alto, California, United States10d ago
-
Software Technical Leader - GenAI Gateway USD 56K-65KCUDA | Concurrency | GPU | GRPC | GoHybrid workSenior-level Full TimeBuenos Aires,Argentina11d ago
-
Asynchronous training | Containerization | Curriculum learning | Distributed Systems | Distributed TrainingSenior-level Full TimeSF Bay Area, CA, Remote, US, … R12d ago
-
Software Engineer III - Data Analytics Platform GBP 72K-104KAPI Development | Autoscaling | Backward Compatibility | Benchmarking | CI/CDSenior-level Full TimeLONDON, United Kingdom12d ago
-
Machine Learning Engineer — Inference Optimization USD 170K-287KBF16 | CUDA | Deep learning | Distributed Systems | FP16Senior-level Full TimeRemote (world) R12d ago
-
Senior Inference Runtime Engineer TWD 1900K-2500KCUDA | CUDA profiling | Continuous batching | Distributed inference | GPU Memory OptimizationFlexible work culture | Inclusive environment | Training and mentoringSenior-level Full TimeSingapore, SG / Penang, MY / …13d ago
-
AI Inference Engineer GBP 80K-106KAutoscaling | Batching | CUDA | Cache Management | Capacity PlanningBiannual bonus | Breakfast allowance | Dinner allowance | Equity sign-on bonus | Expensed technologyMid-level Full TimeLondon, England, United Kingdom - Remote R13d ago
-
Research Engineer, Algorithms USD 300K-400KAnalog computation | Attention Mechanism | Efficient Attention | Inference Optimization | KV cacheMid-level Full TimeNew York City14d ago
-
Senior Software Engineer I, Inference USD 139K-204KAdaptive scheduling | Autoscaling | BF16 | C++ | CI/CD401k match | Dental insurance | Disability insurance | Employee stock purchase program | Flexible PTOSenior-level Full TimeSunnyvale, CA / Bellevue, WA16d ago
-
Senior Director, Inference Products and Optimizations USD 274K-343KAI workload | AI workload orchestration | AMD GPU | CUDA | Container RuntimeConference reimbursement | Education reimbursement | Employee assistance program | Employee stock purchase program | Equity compensationSenior-level Full TimeSeattle16d ago
-
Senior Director, Inference Products and Optimizations USD 274K-343KAI workload | AI workload orchestration | AMD | Benchmarking | Call ManagementEmployee assistance program | Flexible time off | LinkedIn LearningSenior-level Full TimeSan Francisco R16d ago
-
None Full Time上海17d ago
-
Senior-level Full Time上海17d ago
-
Applied AI Research Engineer USD 140K-200KGPU Programming | KV cache | Model Inference | PyTorch | QuantizationConference events | Dental insurance | Fitness stipend | Health insurance | Learning budgetMid-level Full TimeNew York, NY, US / San … R18d ago
-
Cloud Inference Engineer USD 158K-273KAutoscaling | Batch Processing | Cache Management | Distributed Systems | Go401k matching | Flexible paid time off | Health insurance | Remote work option | Team events onsite and meetupsMid-level Full TimeUnited States / Canada18d ago
-
Attention | Batching | C++ | CoreML | Fine TuningSenior-level Full TimeSanta Clara, California, United States19d ago
-
Systems Research Engineer GBP 74K-121KAI infrastructure | C++ | Data Locality | Distributed Systems | Fault ToleranceNone Full TimeEdinburgh, United Kingdom21d ago
-
A/B | A/B Testing | AWS SageMaker | Azure Machine Learning | B testingSenior-level Full TimeUSA | Remote R24d ago
-
Entry-level Full Time北京24d ago
-
Mid-level Full TimeSingapore24d ago
-
Tech Lead Manager, Inference USD 207K-300KAutoscaling | Cache Management | Caching | Continuous batching | Deployment PipelinesSenior-level Full TimeSF Bay Area, CA26d ago
-
AWS | Alertmanager | Amazon EKS | Amazon SageMaker | AutoscalingSenior-level Full TimeGLASGOW, LANARKSHIRE, United Kingdom27d ago
-
Senior-level Full TimePangyo (Software Dream Center), South Korea27d ago
-
Senior-level Full TimeTel Aviv-Yafo, Tel Aviv, ISR27d ago
-
Member of Technical Staff - Inference Research USD 150K-350KAutoscaling | Disaggregated Prefill | FP8 | INT4) | KV cacheIn-person collaborationSenior-level Full TimeNew York27d ago
-
ALiBi | AWS | AWS CDK | Attention Mechanisms | AutoscalingSenior-level Full TimeSG, 04858330d ago
-
APIs | AWQ | AWS | Autoscaling | Backend Development401k plan | Commuter benefits | Paid parental leave | Paid sick leave | Paid time offMid-level Full TimeSan Francisco, CA; Sunnyvale, CA; Seattle, …30d ago