PhD Research, Skoltech — LLM Compression for Efficient Deployment with KV-cache compression, quantization, and LoRA-based PEFT fine-tuning.
Conducted LLM compression research focused on reducing memory footprint and latency during autoregressive inference using training-time and evaluation protocols. Applied post-training quantization and LoRA-based PEFT to adapt models for multilingual text detoxification tasks. Fine-tuned BERT for sentiment regression and assessed stability and generative quality under compression constraints. • Performed KV cache compression research (e.g., quantization/eviction strategies) for efficient inference. • Applied post-training quantization and LoRA PEFT for multilingual text detoxification using MT0. • Fine-tuned BERT for sentiment regression tasks. • Built evaluation protocols beyond accuracy to preserve reasoning stability and generative quality.