Find jobs in AI/ML, Data Science and Big Data
16 results
for Proximal Policy Optimization
(Skill/Tech stack)
-
Actor-critic | CI/CD | Computer Vision | Deep learning | Distributed CheckpointingAutonomy and ownership | Career growth opportunities | Continuous learning support | Flexible work environment | Impactful AI research projectsSenior-level Full TimePortugal4d ago
-
AI Researcher - Post-Training GBP 90K-126KC# | C++ | Data Curation | Efficient Fine Tuning | Fine TuningRelocation supportSenior-level Full TimeLondon5d ago
-
Staff ML Engineer, Agent Training & Environments USD 250K-280KApache Kafka | CI/CD | Cloud platform | Direct Preference Optimization | Google CloudCareer growth tied to impact | Hybrid work model | Ownership and autonomySenior-level Full TimeSan Francisco Bay Area R11d ago
-
机器人真机强化学习算法实习生 CNY 25K-37KActor-critic | Data Analysis | GRPO | Multimodal Learning | Offline Reinforcement LearningEntry-level Internship上海16d ago
-
Asynchronous training | Containerization | Curriculum learning | Distributed Systems | Distributed TrainingSenior-level Full TimeSF Bay Area, CA, Remote, US, … R20d ago
-
Actor-critic | C++ | Computer Vision | Deep learning | Diffusion ModelsEntry-level Full Time上海25d ago
-
CI/CD | ClearML | Containerization | Continuous integration | Curriculum learningFlexible work arrangement | Hybrid work model | Learning opportunities | On-the-job coaching | Work-life balanceMid-level Full TimeUnited Kingdom, London R27d ago
-
AIMet | Actor-critic | Airsim | Domain Randomization | IMUCoffee | Conference sponsorship | Corporate library | Flexible work hours | Health insuranceEntry-level Full TimeKyiv | Київ, UA29d ago
-
Applied Reinforcement Learning Engineer USD 150K-300KA2C | A3C | Actor-critic | Agent systems | BCQCollaborate with industry leaders | Equal opportunity employer | Hybrid remote work | Research publications supportMid-level Full TimeRemote Work( USA), United States R1mo ago
-
Sr AI/ML Engineer USD 143K-197KActor-critic | C# | C++ | CUDA | Cybersecurity401k matching | Health, dental & vision plans | Hybrid work environment | Life insurance | Occasional travelSenior-level Full TimeEnglewood, CO - CO RMN, United …1mo ago
-
真机强化学习实习生 CNY 25K-37KActor-critic | Deep Q Networks | Embodied Foundation Model | Foundation Model | Isaac-GymEntry-level Internship上海1mo ago
-
Actor-critic | Computer Vision | Computer Vision Defect Detection | Data Ingestion | Defect DetectionDental insurance | Flexible spending accounts | Life and disability insurance | Medical insurance | Paid vacation and holidaysSenior-level Full TimeNorth Reading, MA, US1mo ago
-
Staff Software Engineer, AI/ML USD 216K-271KAI Feedback | Agentic AI | Data Pipelines | Direct Preference Optimization | Experimentation platformsConference reimbursement | Education reimbursement | Employee assistance program | Employee stock purchase program | Equity compensationSenior-level Full TimeSeattle1mo ago
-
Senior Software Engineer - Model Training & AI Evals INR 3500K-5000KAI Feedback | Ablation Studies | Benchmarking | CI/CD | Data GenerationSenior-level Full TimeRemote (India) R1mo ago
-
Bayesian optimization | Data Generation | Debugging | DeepSpeed | Distributed SystemsAdditional time off for learning and development | Annual leave | Cycle to work scheme | Employee assistance program | Group personal pensionEntry-level ContractLondon, United Kingdom1mo ago
-
Research Scientist, LLM Evaluation & Post-Training USD 150K-300KAI Feedback | Alignment | Benchmarking | Context evaluation | Deep learningMid-level Full TimeRemote Work( USA), United States R1mo ago