std.audio — PortAudio DSP & Mel Spectrogram Engine
Low-latency real-time audio capture, Cooley-Tukey Radix-2 FFT, Mel-scale filterbanks for Whisper speech AI integration, and Biquad IIR filtering.
1. Whisper AI Native Audio Pipeline (16 kHz Mono)
Configure low-latency PCM audio capture matched to the 16,000 Hz sample rate required by Whisper and speech models:
import std.audio.portaudio
import std.io
pub fn main() {
// Initialize 16 kHz Mono audio engine
let engine = portaudio.create_audio_engine(16000, 1, 512)
std.io.println("Low-Latency Audio Engine Started: SampleRate=" + engine.sample_rate.to_string())
// Convert acoustic frequencies to Mel scale for neural spectrograms
let hz = 1000.0
let mel = portaudio.hz_to_mel(hz)
let roundtrip_hz = portaudio.mel_to_hz(mel)
std.io.println("Frequency: " + hz.to_string() + " Hz -> " + mel.to_string() + " Mel")
std.io.println("Roundtrip: " + roundtrip_hz.to_string() + " Hz")
}
2. Biquad Lowpass Audio Filtering
Remove high-frequency noise and alias artifacts prior to FFT computation:
import std.audio.portaudio
import std.io
pub fn main() {
let mut filter = portaudio.create_lowpass_filter(16000.0, 4000.0, 0.707)
let raw_sample = 0.82
let filtered_sample = portaudio.filter_sample(&mut filter, raw_sample)
std.io.println("Filtered Audio Sample: " + filtered_sample.to_string())
}