autoloops
← Models
ReferenceSpeech-to-text

Qwen3-ASR-1.7B

1.7B · Streaming speech-to-text

Open-source streaming ASR covering 30 languages and 22 Chinese dialects. Competitive with commercial APIs on multilingual and dialect benchmarks — listed here as a reference model.

Listed for reference. Autoloops does not currently expose a customer API for this model.

Model details

Developed byQwen (Alibaba Cloud)
Model familyQwen3-ASR
ArchitectureAuT encoder + Qwen3-1.7B decoder
Parameters~1.7B (decoder) + 300M encoder
Languages30 languages + 22 Chinese dialects
InferenceOffline and streaming
Audio typesSpeech, singing, songs with BGM
LicenseApache 2.0

Capabilities

  • Language identification and transcription across 52 languages and dialects
  • Unified offline / streaming inference from a single checkpoint
  • Robust under complex acoustics, accents, and challenging text patterns
  • Open weights and inference toolkit on Hugging Face and GitHub
  • Not currently offered as an Autoloops customer API

Sources

More models