Skip to content
Open
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
2 changes: 1 addition & 1 deletion src/agents/voice/result.py
Original file line number Diff line number Diff line change
Expand Up @@ -109,7 +109,7 @@ def _transform_audio_buffer(
if output_dtype == np.int16:
return np_array
elif output_dtype == np.float32:
return (np_array.astype(np.float32) / 32767.0).reshape(-1, 1)
return (np_array.astype(np.float32) / 32768.0).reshape(-1, 1)
else:
raise UserError("Invalid output dtype")

Expand Down
23 changes: 23 additions & 0 deletions tests/voice/test_audio_result_pcm.py
Original file line number Diff line number Diff line change
@@ -0,0 +1,23 @@
import numpy as np

from agents.voice import StreamedAudioResult, TTSModelSettings, VoicePipelineConfig

from .pipeline_test_models import ZeroPcmTTSModel


def test_streamed_audio_result_normalizes_pcm16_full_scale_to_float32() -> None:
result = StreamedAudioResult(
ZeroPcmTTSModel(),
TTSModelSettings(dtype=np.float32),
VoicePipelineConfig(),
)
samples = np.array([-32768, 32767], dtype=np.int16)

transformed = result._transform_audio_buffer([samples.tobytes()], np.float32)

assert transformed.dtype == np.float32
assert transformed.shape == (2, 1)
assert transformed[0, 0] == -1.0
assert transformed[1, 0] == np.float32(32767 / 32768)
assert np.all(transformed >= -1.0)
assert np.all(transformed <= 1.0)