Find jobs in AI/ML, Data Science and Big Data
20 results
for Reinforcement Learning from AI Feedback
(Skill/Tech stack)
-
AI Feedback | Agent Orchestration | Agent systems | Automated Evaluation | Computer VisionEntry-level Full TimeSingapore7d ago
-
AI Feedback | Agent Orchestration | C++ | Context Compaction | Context EditingCommunity events | Industry expert collaboration | Professional development eventsEntry-level InternshipSingapore7d ago
-
AI Agent Algorithm Engineer Intern (Global E-Commerce, Conversational AI) - 2027 Start (PhD) SGD 57K-60KAI Feedback | C++ | Context Summarization | Deep learning | Direct Preference OptimizationEntry-level InternshipSingapore7d ago
-
AI Agent Algorithm Engineer Graduate (Global E-Commerce, Conversational AI) - 2027 Start (PhD) SGD 60K-60KAI Feedback | Agent Orchestration | C++ | Context Summarization | Cost OptimizationEntry-level Full TimeSingapore7d ago
-
Research Engineer, Codex USD 295K-445KAI Feedback | Agent systems | Behavior Analysis | Computer use | Cost OptimizationMid-level Full TimeSan Francisco10d ago
-
AI Feedback | Context engineering | Data Curation | Deep learning | DeepSpeedSenior-level Full TimeSingapore, Singapore13d ago
-
AI Feedback | Ablation Studies | Autolabeling | Chain-of-Thought | DPOBonus | Company benefits program | Equity | Health and wellness benefitsSenior-level Full TimeMountain View, California, United States18d ago
-
Foundation AI Engineer (LLM) CAD 100K-110KAI Feedback | Attention Mechanisms | Constitutional AI | Constitutional Safety Tuning | Data CurationAnnual health checkups | Healthcare insurance | Opportunity to collaborate with industry professionals | Performance bonuses | Preferential pricing for servicesMid-level Full TimeHanoi, Vietnam25d ago
-
AI Feedback | Checkpointing | Cost Performance | Cost-performance tradeoffs | Data Decontamination401k matching | Country specific visa support | Flexible work arrangements | Medical, dental, and vision options | Parental leaveSenior-level Full TimePalo Alto, California, United States1mo ago
-
AI Feedback | Data Pipelines | Evaluation | Experiment design | GradingMid-level Full TimeSan Francisco1mo ago
-
Agent Post-Training, API & Power Users USD 295K-445KAI Feedback | Agent systems | Computer use | Cost Optimization | Data GenerationSenior-level Full TimeSan Francisco1mo ago
-
Agent Post-Training Research USD 295K-445KAI Feedback | Agent systems | Calibrated Reasoning | Data Pipelines | Deep learningMid-level Full TimeSan Francisco1mo ago
-
Staff Software Engineer, AI/ML USD 216K-271KAI Feedback | Agentic AI | Data Pipelines | Direct Preference Optimization | Experimentation platformsConference reimbursement | Education reimbursement | Employee assistance program | Employee stock purchase program | Equity compensationSenior-level Full TimeSeattle1mo ago
-
Senior Machine Learning Engineer, Computer Vision/VLM USD 204K-259KAI Feedback | Computer Vision | Data Processing | Data Processing Pipelines | Deep learningSenior-level Full TimeMountain View, CA, USA; San Francisco, …1mo ago
-
Senior Solutions Architect, Generative AI Research USD 184K-287KAI Agents | AI Feedback | Agent evaluation | Artificial Intelligence | BatchingSenior-level Full TimeUS, FL, Remote, United States R1mo ago
-
Director, Reinforcement Learning & Agentic Post-Training EUR 151K-200KAI Feedback | API Integration | Distributed Training | Environment Design | EvaluationExecutive-level Full TimeParis, France1mo ago
-
Senior Software Engineer - Model Training & AI Evals INR 3500K-5000KAI Feedback | Ablation Studies | Benchmarking | CI/CD | Data GenerationSenior-level Full TimeRemote (India) R1mo ago
-
AI Feedback | Agent Orchestration | Agent systems | Agentic AI | Autonomous ReasoningSenior-level Full TimeSeoul, South Korea1mo ago
-
Head of Physical AI Programs USD 300KAI Data | AI Feedback | AI data operations | Autonomous Systems | BenchmarkingExecutive-level Full TimeEast Palo Alto, CA, United States1mo ago
-
Research Scientist, LLM Evaluation & Post-Training USD 150K-300KAI Feedback | Alignment | Benchmarking | Context evaluation | Deep learningMid-level Full TimeRemote Work( USA), United States R1mo ago