Librosa
Librosa is a Python library for analyzing and processing audio signals. It provides functionalities such as feature extraction, visualization, and audio effects, which are essential for audio analysis in video applications.
Link
Related resources
- audioprintPython MFCC-based perceptual-hash audio fingerprinting library.
- python-video-converterPython library wrapping ffmpeg/ffprobe with a declarative Converter().convert() API for scripting format/audio/video conversion pipelines.
- spectreGo audio fingerprinting library built specifically for syncing movie subtitles to audio tracks.
- Normalize-AudioBatch EBU R128 loudness normalization tool for MKV files via ffmpeg, preserves video stream and caches loudness analysis.
- SpectroMap: Peak Detection Algorithm for Audio FingerprintingAcademic paper on a peak-detection algorithm for audio fingerprinting with implementation.
- Evaluating Video Quality Metrics for Neural and Traditional Codecs (4K/UHD-1)Academic comparison of VMAF, AVQBits, and FasterVQA no-reference quality metrics on 4K content.
- Bitrate Ladder Construction via Transfer Learning and Spatio-Temporal FeaturesML-based bitrate ladder optimization achieving 94.1% complexity reduction at only 1.71% BD-rate cost using transfer learning.
- VMAF-torchPyTorch reimplementation of VMAF metric, GPU/gradient-friendly for use in learned codec optimization loops.
- CompressedVQA: Full/No-Reference VQA for Compressed UGC VideoICME 2021 grand challenge-winning full-reference and no-reference video quality models for compressed user-generated content.
- 2BiVQA: Double Bi-LSTM No-Reference Video Quality AssessmentNo-reference VQA model for UGC video using double Bi-LSTM, companion code to arXiv:2208.14774.