Find jobs in AI/ML, Data Science and Big Data
30 results
for Policy Optimization
(Skill/Tech stack)
-
Actor-critic | CI/CD | Computer Vision | Deep learning | Distributed CheckpointingAutonomy and ownership | Career growth opportunities | Continuous learning support | Flexible work environment | Impactful AI research projectsSenior-level Full TimePortugal4d ago
-
AI Researcher - Post-Training CHF 128K-192KC# | C++ | Data Curation | Efficient Fine Tuning | Fine TuningIn-office collaboration days | Relocation supportSenior-level Full TimeGeneva4d ago
-
AI Researcher - Post-Training GBP 90K-126KC# | C++ | Data Curation | Efficient Fine Tuning | Fine TuningRelocation supportSenior-level Full TimeLondon4d ago
-
Applied Scientist - Reinforcement learning, OMHS SCS USD 142K-193KActor-critic | C++ | Contextual Bandits | Decision Making | Deep reinforcement learning401k matching | Dental insurance | Employee assistance program mental health support | Flexible spending accounts | Health insuranceEntry-level Full TimeNorth Reading, Massachusetts, USA6d ago
-
Senior Machine Learning Engineer, Data Mining USD 172K-229KA/B | A/B Testing | AWS | Actor-critic | AzureSenior-level Full TimeBoston, Massachusetts, United States; Las Vegas, … R6d ago
-
Deep learning | Experimentation | Git | Hyperparameter Tuning | Language ModelsFlexible working hours | Fully remote | Independent contractor engagementMid-level Full TimeUnited States - Remote R11d ago
-
Staff ML Engineer, Agent Training & Environments USD 250K-280KApache Kafka | CI/CD | Cloud platform | Direct Preference Optimization | Google CloudCareer growth tied to impact | Hybrid work model | Ownership and autonomySenior-level Full TimeSan Francisco Bay Area R11d ago
-
Senior Deep Learning Scientist, Multimodal Agentic RL USD 184K-287KDataset versioning | Deep learning | Distributed Training | Experiment tracking | Instruction TuningComprehensive benefits package | EquitySenior-level Full TimeUS, CA, Santa Clara R14d ago
-
机器人真机强化学习算法实习生 CNY 25K-37KActor-critic | Data Analysis | GRPO | Multimodal Learning | Offline Reinforcement LearningEntry-level Internship上海16d ago
-
Staff Applied Scientist - Machine Learning USD 470K-615KBayesian Methods | Contextual Bandits | Deep learning | Distributed Training | Embeddings401k matching | Catered lunch | Equity | Health insurance | Paid time offSenior-level Full TimeAustin, Texas, United States18d ago
-
Reinforcement Learning AI Engineer USD 99K-225KArtificial neural networks | C# | C++ | CUDA | ContainerizationDependent care | Paid leave | Professional development | Tuition assistance | Work-life programsMid-level Full TimeUSA, AL, Huntsville (310 The Bridgestreet), …19d ago
-
Asynchronous training | Containerization | Curriculum learning | Distributed Systems | Distributed TrainingSenior-level Full TimeSF Bay Area, CA, Remote, US, … R19d ago
-
Principal Machine Learning Engineer INR 4000K-5500KAWS | Amazon SageMaker | Azure | Cloud platform | Deep learningSenior-level Full TimeIndia - Hyderabad21d ago
-
Actor-critic | C++ | Computer Vision | Deep learning | Diffusion ModelsEntry-level Full Time上海25d ago
-
CI/CD | ClearML | Containerization | Continuous integration | Curriculum learningFlexible work arrangement | Hybrid work model | Learning opportunities | On-the-job coaching | Work-life balanceMid-level Full TimeUnited Kingdom, London R27d ago
-
AIMet | Actor-critic | Airsim | Domain Randomization | IMUCoffee | Conference sponsorship | Corporate library | Flexible work hours | Health insuranceEntry-level Full TimeKyiv | Київ, UA29d ago
-
Applied Reinforcement Learning Engineer USD 150K-300KA2C | A3C | Actor-critic | Agent systems | BCQCollaborate with industry leaders | Equal opportunity employer | Hybrid remote work | Research publications supportMid-level Full TimeRemote Work( USA), United States R1mo ago
-
Sr AI/ML Engineer USD 143K-197KActor-critic | C# | C++ | CUDA | Cybersecurity401k matching | Health, dental & vision plans | Hybrid work environment | Life insurance | Occasional travelSenior-level Full TimeEnglewood, CO - CO RMN, United …1mo ago
-
真机强化学习实习生 CNY 25K-37KActor-critic | Deep Q Networks | Embodied Foundation Model | Foundation Model | Isaac-GymEntry-level Internship上海1mo ago
-
AI Feedback | Checkpointing | Cost Performance | Cost-performance tradeoffs | Data Decontamination401k matching | Country specific visa support | Flexible work arrangements | Medical, dental, and vision options | Parental leaveSenior-level Full TimePalo Alto, California, United States1mo ago
-
Data Pipelines | Evaluation | Fine Tuning | Human Feedback | LLM Fine-tuningSenior-level Full TimeParis, France1mo ago
-
Actor-critic | Computer Vision | Computer Vision Defect Detection | Data Ingestion | Defect DetectionDental insurance | Flexible spending accounts | Life and disability insurance | Medical insurance | Paid vacation and holidaysSenior-level Full TimeNorth Reading, MA, US1mo ago
-
Staff Software Engineer, AI/ML USD 216K-271KAI Feedback | Agentic AI | Data Pipelines | Direct Preference Optimization | Experimentation platformsConference reimbursement | Education reimbursement | Employee assistance program | Employee stock purchase program | Equity compensationSenior-level Full TimeSeattle1mo ago
-
Director, Reinforcement Learning & Agentic Post-Training EUR 151K-200KAI Feedback | API Integration | Distributed Training | Environment Design | EvaluationExecutive-level Full TimeParis, France1mo ago
-
Engineering Manager, MLE USD 293K-385KAlgorithms | Data Pipelines | Data Structures | Deep learning | Fine TuningMid-level Full TimeSan Francisco1mo ago
-
Bandit Algorithms | Data Analysis | Deep learning | Generative AI | Language ModelsCareer growth opportunities | Hands-on project experience | Research mentorshipEntry-level InternshipSan Jose, California, United States1mo ago
-
Senior Software Engineer - Model Training & AI Evals INR 3500K-5000KAI Feedback | Ablation Studies | Benchmarking | CI/CD | Data GenerationSenior-level Full TimeRemote (India) R1mo ago
-
Bayesian optimization | Data Generation | Debugging | DeepSpeed | Distributed SystemsAdditional time off for learning and development | Annual leave | Cycle to work scheme | Employee assistance program | Group personal pensionEntry-level ContractLondon, United Kingdom1mo ago
-
Research Scientist, LLM Evaluation & Post-Training USD 150K-300KAI Feedback | Alignment | Benchmarking | Context evaluation | Deep learningMid-level Full TimeRemote Work( USA), United States R1mo ago
-
Data Scientist (Remote) USD 120K-180KAbuse Resistance | Agent safety | Agentic Planning | Data scaling | DeepSpeedEmployee networks | Great Place to Work certified | Office culture | Paid adoption leave | Paid parental leaveMid-level Full TimeUSA VA Remote, United States R1mo ago