Skip to content

SpeechToText.transcribe() drops preceding 30-second chunks on audio > 30s when verbose: false #1343

Description

@xgiovio

Description

When transcribing audio waveforms longer than 30 seconds (e.g., 60s recording), calling transcribe(waveform, { verbose: false }) drops/discards all preceding 30-second windows and returns only the final 30-second window segment.
Passing { verbose: true } resolves the issue and returns the complete transcription across all 30-second windows.

Steps to reproduce

  1. Record or generate a PCM 16kHz Float32Array audio waveform longer than 30 seconds (e.g., 60 seconds of speech).
  2. Execute sttModel.transcribe(waveform, { language: 'en', verbose: false }).
  3. Inspect result.text.

Snack or a link to a repository

No response

React Native Executorch version

latest

React Native version

0.86.2

Platforms

iOS

JavaScript runtime

None

Workflow

None

Architecture

None

Build type

None

Device

None

Device model

No response

AI model

No response

Performance logs

No response

Acknowledgements

Yes

Metadata

Metadata

Assignees

Labels

Communityimportant ❗This issue has high priorityuser expThis issue tackles problems with user experience e.g. overcomplicated API

Type

Projects

No projects

Milestone

No milestone

Relationships

None yet

Development

No branches or pull requests

Issue actions