aijobs.net

Performance Engineer, Inference

Bengaluru R

INR 4000K-6000K (estimate) Senior-level Full Time

Apply Save
Found 4h ago
Tasks
Perks/Benefits
Skills/Tech-stack

C++ | CUDA | Copy-on-write | Disaggregated Prefill | Disaggregated prefill decode | Distributed Computing | EP | Fragmentation | Framework Tracing | Inference Serving | KV Cache Transfer | KV cache | Multi Tenant Serving | Multi-tenant | NVIDIA MIG | NVIDIA MPS | NVIDIA NCCL | Nsight Systems | Nvidia Dynamo | On-Call | PP | Perf | Prefill Decode | Prefix Sharing | Profiling | PySpy | SGLang | Scheduler | Speculative decoding | TP | TensorRT-LLM | VLLM

Education

N/A

Roles

Engineer | ML Performance Engineer | Performance Engineer

Regions

Asia/Pacific

Countries

India

States

Tamil Nadu, IN | Karnataka, IN

Cities

Bengaluru, Karnataka, IN | Chennai, Tamil Nadu, IN

Apply Save
Language: en Views: 1 Clicks: 0 Saves: 0

Related jobs