Develop production-level, low-latency, memory-safe C++ and CUDA code for real-time perception algorithms on vehicle systems.
Optimize multimodal sensor-fusion models, LLMs, VLMs, and other large-scale models using quantization, pruning, and mixed-precision inference.
Architect model conversion and compilation pipelines using TensorRT for edge deployment.
Perform model parity checking, accuracy recovery, and latency benchmarking between PyTorch models and compiled edge binaries.
Develop and optimize custom ML operations and TensorRT plugins with efficient CUDA kernels for AI accelerators.
Requirements
Production-level C++ and Python programming experience, including concurrent, memory-safe, real-time inference code for edge devices.
Deep expertise in model compression, including PTQ, QAT, pruning, and mixed-precision inference such as INT8, FP8, BF16, and FP16.
Experience optimizing large-scale multimodal sensor-fusion models, LLMs, VLMs, or VLAs using efficient attention and KV-cache optimization.
Extensive experience with model conversion and compilation pipelines including ONNX, TensorRT, and torch.compile, along with latency benchmarking and model-quality parity evaluation.
Proficiency in low-level AI accelerator programming, custom ML operations, TensorRT plugins, and CUDA kernel optimization.
Familiarity with autonomous-driving perception algorithms, including temporal 3D object detection, BEV, and 3D Occupancy Networks, is a bonus.
Experience with vision, LiDAR, and radar sensor processing, autonomous-driving VLM/VLA or foundation models, and TensorRT-LLM is a bonus.
Salary: $199k - $270k/yr
Zoox
Zoox is transforming mobility-as-a-service by developing a fully autonomous, purpose-built fleet designed for AI to drive and humans to enjoy.