Real-Time Translator — Statistical Signal Processing
Thiết kế pipeline xử lý tín hiệu âm thanh nhằm tách giọng nói khỏi nhiễu nền bằng statistical Voice Activity Detection (VAD). Thực hiện benchmark và so sánh nhiều phương án inference để tối ưu trade-off giữa tốc độ và độ chính xác dựa trên đo lường thực nghiệm. Công việc mang tính AI training/optimization thông qua lựa chọn mô hình và cấu hình phù hợp cho bài toán. • Xây dựng VAD energy-based dựa trên thống kê bằng numpy/scipy • So sánh inference giữa Whisper và faster-Whisper • So sánh float16 vs int8 quantization để tối ưu hiệu năng • Ra quyết định dựa trên kết quả benchmark thực nghiệm