PyTorch Audio Learning

Tutorial series on audio processing with TorchAudio — spectrograms, MFCC, pitch, speech recognition.

Repo: https://github.com/chrisaacson69/pytorch-audio-learning Links: PyTorch Learning, Camelot From YouTube

Overview

Six-part tutorial on audio processing with TorchAudio and PyTorch. Covers the full pipeline from loading audio files through feature extraction to speech recognition. Includes scipy fallback for Windows compatibility when FFmpeg is unavailable.

Lessons

  1. Audio Basics — loading, metadata, waveform visualization
  2. Feature Extraction — spectrograms, Mel-spectrograms, MFCC
  3. Pitch & Augmentation — pitch detection, time/frequency masking
  4. Resampling — sample rate conversion techniques
  5. Speech Recognition — Wav2Vec2 inference
  6. TorchCodec — modern audio API

Tags

python, pytorch, audio-processing, machine-learning