Build a large language model inference infrastructure from scratch, covering vLLM distributed deployment, GPU memory optimization strategies, and NVIDIA MIG partitioning practices.
Build an end-to-end MLOps automation pipeline from data preparation and model training to production deployment, enabling continuous delivery and monitoring of machine learning models.