Find jobs in AI/ML, Data Science and Big Data
19 results
for GRPO
(Skill/Tech stack)
-
Causal Inference | Cross-modal fusion | DPO | Data Modeling | Fraud DetectionEntry-level Full TimeSan Jose, California, United States4h ago
-
机器人真机强化学习算法实习生 CNY 25K-37KActor-critic | Data Analysis | GRPO | Multimodal Learning | Offline Reinforcement LearningEntry-level Internship上海2d ago
-
AI Feedback | Ablation Studies | Autolabeling | Chain-of-Thought | DPOBonus | Company benefits program | Equity | Health and wellness benefitsSenior-level Full TimeMountain View, California, United States4d ago
-
LLM Engineer (Reinforcement Learning) KRW 26800K-26800KDDP | DPO | Deep learning | Distributed Training | DockerSenior-level Full TimePangyo (Software Dream Center), South Korea5d ago
-
Entry-level Internship上海、北京5d ago
-
Principal AI/ML Researcher USD 270K-300KArtificial Intelligence | Context Parallelism | DPO | Data parallelism | Deep learningEquity compensation | Health and wellness benefits | Relocation assistanceSenior-level Full TimeBoston, MA10d ago
-
Data Scientist - Agentic AI Systems - IFS Loops USD 140K-150KAutogen | DPO | Deep learning | Embeddings | Evaluation401k company match | Disability benefits | Flexible paid time off | Flexible spending accounts | Life insuranceMid-level Full TimePalo Alto, California, United States10d ago
-
Foundation AI Engineer (LLM) CAD 100K-110KAI Feedback | Attention Mechanisms | Constitutional AI | Constitutional Safety Tuning | Data CurationAnnual health checkups | Healthcare insurance | Opportunity to collaborate with industry professionals | Performance bonuses | Preferential pricing for servicesMid-level Full TimeHanoi, Vietnam12d ago
-
Senior AI scientist INR 3715K-5449KALiBi | Adafactor Optimizer | AdamW | Attention Mechanisms | BF16Senior-level Full TimeRemote - India R18d ago
-
Machine Learning Engineer, Proactive USD 170K-300KDPO | Deep learning | Efficient Fine Tuning | Factuality Evaluation | Fine TuningSenior-level Full TimeCupertino18d ago
-
Applied Reinforcement Learning Engineer USD 150K-300KA2C | A3C | Actor-critic | Agent systems | BCQCollaborate with industry leaders | Equal opportunity employer | Hybrid remote work | Research publications supportMid-level Full TimeRemote Work( USA), United States R19d ago
-
大模型算法工程师(开放域对话) CNY 180K-300KData Deduplication | Data cleaning | DeepSpeed | Dialogue State Tracking | Distributed TrainingMid-level Internship上海、北京20d ago
-
Senior AI Scientist USD 123K-197KALiBi | Adafactor | AdamW | Attention | BF16Annual bonus opportunity | Company RRSP contribution | Equity awards | Hybrid work | Insurance coverageSenior-level Full TimeRemote - USA, United States R21d ago
-
Software Dev Engineer II, Stores Foundational AI -SFAI USD 143K-194KAsync Rollouts | Batching | C++ | CUDA | Data Delivery401k matching | Health insurance | Paid time off | Parental leaveMid-level Full TimeSeattle, Washington, USA28d ago
-
Director, Reinforcement Learning & Agentic Post-Training EUR 151K-200KAI Feedback | API Integration | Distributed Training | Environment Design | EvaluationExecutive-level Full TimeParis, France1mo ago
-
Senior Machine Learning Engineer – LLMs EUR 62K-90KAccelerate | Axolotl | BF16 | DPO | Data DeduplicationAutonomy | Hybrid work model | Professional growth | Top-spec equipmentSenior-level Full TimeNetherlands - Amsterdam1mo ago
-
Intern Engineer – RL Post-Training for LLMs CAD 58K-104KData Generation | Deep learning | DeepSpeed | Distributed Training | GRPOInternshipEntry-level InternshipVancouver, British Columbia, Canada1mo ago
-
Data Scientist - Agentic AI Systems - Loops USD 140K-150KAgent coordination | Autogen | DPO | Decision Making | Decision-making models401k match | Dental insurance | Disability benefits | Flexible paid time off | Flexible spending accountsMid-level Full TimePalo Alto, California, United States1mo ago
-
Research Engineer - LLM Training & Alignment Systems CAD 127K-225KAutomation | Benchmarking | C# | C++ | Data CurationMid-level Contract Full TimeKingston, Ontario, Canada1mo ago