Find jobs in AI/ML, Data Science and Big Data
2 results
for Generalized Reward Policy Optimization
(Skill/Tech stack)
-
Machine Learning Research Engineer | Kilby Labs USD 137K-238KC# | C++ | Deep learning | Direct Preference Optimization | EmbeddingsCareer development | Employee wellbeingMid-level Full TimeUnited States13d ago
-
Research Scientist, LLM Evaluation & Post-Training USD 150K-300KAI Feedback | Alignment | Benchmarking | Context evaluation | Deep learningMid-level Full TimeRemote Work( USA), United States R1mo ago