Find jobs in AI/ML, Data Science and Big Data
8 results
for Efficient Attention
(Skill/Tech stack)
-
Staff ML Engineer, Perception Research USD 251K-310K3D Perception | Autoregressive models | Data Pipelines | Data parallelism | Diffusion Models401k match | Baby bonding leave | Dental insurance | Disability insurance | Health insuranceSenior-level Full TimeMountain View, CA, USA ; New … R2d ago
-
AI Research Scientist: Multimodal Foundation Models - Architecture, Pre-Training & Distillation USD 180K-250KCurriculum learning | Data Tokenization | Deep learning | Distributed Training | Efficient AttentionSenior-level Full TimeSeattle; Sunnyvale13d ago
-
Research Engineer, Algorithms USD 300K-400KAnalog computation | Attention Mechanism | Efficient Attention | Inference Optimization | KV cacheMid-level Full TimeNew York City22d ago
-
AI Research Scientist: Multimodal Foundation Models - Architecture, Pre-Training & Distillation USD 180K-250KCurriculum learning | Data Mixtures | Distributed Training | Efficient Attention | JAXSenior-level Full TimeSeattle; Sunnyvale23d ago
-
AI Research Scientist: Multimodal Foundation Models - Architecture, Pre-Training & Distillation USD 180K-250KCo-design | Curriculum learning | Data Mixtures | Deep learning | Distributed TrainingSenior-level Full TimeSeattle; Sunnyvale23d ago
-
AI Research Scientist: Multimodal Foundation Models - Architecture, Pre-Training & Distillation USD 180K-250KData Mixtures | Deep learning | Distributed Training | Efficient Attention | Inference OptimizationSenior-level Full TimeSeattle; Sunnyvale23d ago
-
CI/CD | ClearML | Containerization | Continuous integration | Curriculum learningFlexible work arrangement | Hybrid work model | Learning opportunities | On-the-job coaching | Work-life balanceMid-level Full TimeUnited Kingdom, London R27d ago
-
Data parallelism | Diffusion Models | Efficient Attention | Expert parallelism | FlaxSenior-level Full TimeMountain View, California, United States, New …1mo ago