aijobs.net

大语言模型后训练/Agentic算法工程师

上海、北京

CNY 180K-360K (estimate) Entry-level Full Time

Apply Save
Found 2h ago
Tasks
Perks/Benefits
Skills/Tech-stack

Agentic RL | DAPO | Distributed Training | Evaluation Frameworks | Function Calling | GRPO | Inference Serving | JSON | Java | Language Processing | Learning algorithms | Long Horizon Task Learning | Machine Learning | Memory | Model Training | Natural Language | Natural Language Processing | On Policy | On policy Distillation | OpenRLHF | PPO | PPO Reinforcement Learning | Planning | Policy Distillation | Preference Learning | Python | RLHF | RLVR | React | Reflection | Reinforcement Learning | Reinforcement learning algorithms | Reward Modeling | Sparse Reward | Sparse Reward Modeling | TRL | Tool Integrated Reasoning | Trajectory Optimization | TypeScript | VeRL

Education

Bachelor of Engineering | Master of Science | PhD

Roles

Agentic Algorithms Engineer | Algorithms Engineer | Engineer | Language Model Engineer | Large Language Model Engineer | Model Engineer

Regions

Asia/Pacific

Countries

China

States

Shanghai, CN | Beijing, CN

Cities

Shanghai, Shanghai, CN | Beijing, Beijing, CN

Apply Save
Language: zh Views: 2 Clicks: 0 Saves: 0

Related jobs