Alibaba har frigivet Qwen3-TTS, en omfattende text-to-speech model familie med muligheder for voice cloning, voice design og multi-lingual synthesis. Systemet kan klone stemmer fra kun 3 sekunders audio og leverer første audio efter ca. 97ms latency. Med fuld open-source tilgængelighed inkl. modeller, tokenizer og kode, udfordrer dette lukkede kommercielle løsninger som ElevenLabs og markerer en demokratisering af avanceret voice AI teknologi.