Find jobs in AI/ML, Data Science and Big Data
16 results
for Proximal Policy Optimization
(Skill/Tech stack)
-
AI Feedback | Apache Spark | Cloud Platforms | Data Engineering | Deep learningSenior-level Full TimeParis, France4d ago
-
Machine Learning Engineer Graduate (E-Commerce Supply Chain & Logistics - LLM/Agent) - 2027 Start (PhD) USD 137K-246KAI Feedback | Agents | Benchmarking | C++ | DPOEntry-level Full TimeSeattle, Washington, United States10d ago
-
Machine Learning Engineer Intern (E-Commerce Supply Chain & Logistics-LLM / Agent) - 2027 Start (PhD) USD 137K-246KBenchmarking | C++ | Context understanding | Direct Preference Optimization | Evidence GroundingEntry-level InternshipSeattle, Washington, United States10d ago
-
Research Scientist- Robotics AI USD 165K-185K3D Reconstruction | 3D Scene | 3D Scene Understanding | BEV grid | Behavior planning401k match | Conference participation | Disability protection | Financial planning support | Health insuranceMid-level Full TimeSunnyvale, CA, United States11d ago
-
Data Generation | Data Processing | DeepSpeed | Direct Preference Optimization | Distributed TrainingEntry-level Full TimeSan Jose, California, United States15d ago
-
Tech Lead, Robotic AI Model USD 150K-180KAction Tokenization | Behavior Cloning | Data Augmentation | Data Quality | Data Quality FilteringSenior-level Full TimeEl Segundo, California, United States17d ago
-
Applied AI | Attention Mechanisms | Explainable AI | Git | Graph Machine LearningDental insurance | Flexible spending accounts | Life and disability insurance | Medical insurance | Paid vacation and holidaysEntry-level Full TimeNorth Reading, MA, US20d ago
-
AI Researcher - Post-Training GBP 90K-126KC# | C++ | Data Curation | Efficient Fine Tuning | Fine TuningRelocation supportSenior-level Full TimeLondon25d ago
-
Staff ML Engineer, Agent Training & Environments USD 250K-280KApache Kafka | CI/CD | Cloud platform | Direct Preference Optimization | Google CloudCareer growth tied to impact | Hybrid work model | Ownership and autonomySenior-level Full TimeSan Francisco Bay Area R1mo ago
-
机器人真机强化学习算法实习生 CNY 25K-37KActor-critic | Data Analysis | GRPO | Multimodal Learning | Offline Reinforcement LearningEntry-level Internship上海1mo ago
-
Asynchronous training | Containerization | Curriculum learning | Distributed Systems | Distributed TrainingSenior-level Full TimeSF Bay Area, CA, Remote, US, … R1mo ago
-
Actor-critic | C++ | Computer Vision | Deep learning | Diffusion ModelsEntry-level Full Time上海1mo ago
-
CI/CD | ClearML | Containerization | Continuous integration | Curriculum learningFlexible work arrangement | Hybrid work model | Learning opportunities | On-the-job coaching | Work-life balanceMid-level Full TimeUnited Kingdom, London R1mo ago
-
AIMet | Actor-critic | Airsim | Domain Randomization | IMUCoffee | Conference sponsorship | Corporate library | Flexible work hours | Health insuranceEntry-level Full TimeKyiv | Київ, UA1mo ago
-
Applied Reinforcement Learning Engineer USD 150K-300KA2C | A3C | Actor-critic | Agent systems | BCQCollaborate with industry leaders | Equal opportunity employer | Hybrid remote work | Research publications supportMid-level Full TimeRemote Work( USA), United States R1mo ago
-
Sr AI/ML Engineer USD 143K-197KActor-critic | C# | C++ | CUDA | Cybersecurity401k matching | Health, dental & vision plans | Hybrid work environment | Life insurance | Occasional travelSenior-level Full TimeEnglewood, CO - CO RMN, United …1mo ago