• Home
  • Technology
  • Gaming
  • Entertainment
  • World & Business
  • Science
  • Sports
  • AI
HomeTechnologyGamingEntertainmentWorld & BusinessScienceSportsAI
  • HomeTechnologyGamingEntertainmentWorld & BusinessScienceSportsAI
    • Home
    • Technology
    • Gaming
    • Entertainment
    • World & Business
    • Science
    • Sports
    • AI
    AI

    WaveNet co-creator traces a decade of speech AI

    The researcher describes a path from generating raw audio waveforms to multimodal systems such as Gemini, and anticipates more expressive speech, faster dialogue and integration with robots.

    NA
    KK
    HZ
    3 Sources, ,

    TLDR

    In a September 8, 2026 retrospective, a researcher who helped create WaveNet marks 10 years since announcing the speech synthesis system. Their account traces developments from WaveNet’s direct generation of raw audio waveforms through systems that encode audio as tokens for language models, then to multimodal models such as Gemini that combine different types of information. Looking toward the next decade, they expect finer expression of context and emotion, very low-latency dialogue and integration with robots.

    Combined views

    11.1K

    3 Sources, first seen 22d ago

    Combined views

    11.1K

    3 Sources, first seen 22d ago

    120 likes
    22d ago
    first seen 22d ago
    120 likes
    40 comments
    41 saves
    102 reposts

    Sentiment

    Positive——Negative

    Summary

    Not enough discussion yet.

    No sentiment analysis available yet.

    40 comments
    41 saves
    102 reposts

    Sentiment

    Positive——Negative

    Summary

    Not enough discussion yet.

    No sentiment analysis available yet.

    Today's Rank

    —

    Not ranked yet

    Today's Rank

    —

    Not ranked yet

    3 Sources

    @heiga_zen【音声合成技術の10年:WaveNetからマルチモーダルLLMへ】 「DeepMindの研究者と一緒に新しいニューラルネットベースの音声合成システムを作りました。品質はLSTMや波形接続型音声合成器を上回ってます。」と投稿してから、ちょうど10年が経ちました。当時発表したWaveNetは、生の音声波形を直接生成する画期的なアプローチによって、波形接続型や統計的パラメトリック音声合成が主流だった音声技術のパラダイムを大きく塗り替えました 🎙️ それからの10年における音声合成技術の進化は目覚ましいものでした。Tacotronに代表されるEncoder-Decoderモデルがテキストから音響特徴量のEnd-to-End生成を実現し、VITSやNaturalSpeechなどのText-to-Waveformモデルがテキスト・音響両方とも中間表現を介さず高品質な波形を直接出力可能にしました。さらにSoundStreamを使ったAudioLMやVALL-Eのように音声をトークン化してLLMの枠組みに統合する手法を経て、現在ではGeminiのように、複数のモダリティの情報をシームレスに融合したマルチモーダルLLMが自然な発話と対話を生成する時代へと到達しています 📊 この10年間の歩みと研究コミュニティの素晴らしい成功を祝福するとともに、かつてないスピードで進化を続けるこの分野に関わり続けれたことを嬉しく思います。次の10年では、文脈や感情のより精緻な表現、超低遅延な対話、ロボットとの統合など、さらなる飛躍が待ち受けているはずです。音声AIが切り拓くこれからの未来に、大いに期待しています 🚀
    @kastnerkyleRT @heiga_zen: 【音声合成技術の10年:WaveNetからマルチモーダルLLMへ】…
    @nalkalcRT @sedielem: 10 years today since we unveiled WaveNet! Autoregression with long context before it was cool😅 Maybe it looks a bit silly n…

    3 Sources

    @heiga_zen【音声合成技術の10年:WaveNetからマルチモーダルLLMへ】 「DeepMindの研究者と一緒に新しいニューラルネットベースの音声合成システムを作りました。品質はLSTMや波形接続型音声合成器を上回ってます。」と投稿してから、ちょうど10年が経ちました。当時発表したWaveNetは、生の音声波形を直接生成する画期的なアプローチによって、波形接続型や統計的パラメトリック音声合成が主流だった音声技術のパラダイムを大きく塗り替えました 🎙️ それからの10年における音声合成技術の進化は目覚ましいものでした。Tacotronに代表されるEncoder-Decoderモデルがテキストから音響特徴量のEnd-to-End生成を実現し、VITSやNaturalSpeechなどのText-to-Waveformモデルがテキスト・音響両方とも中間表現を介さず高品質な波形を直接出力可能にしました。さらにSoundStreamを使ったAudioLMやVALL-Eのように音声をトークン化してLLMの枠組みに統合する手法を経て、現在ではGeminiのように、複数のモダリティの情報をシームレスに融合したマルチモーダルLLMが自然な発話と対話を生成する時代へと到達しています 📊 この10年間の歩みと研究コミュニティの素晴らしい成功を祝福するとともに、かつてないスピードで進化を続けるこの分野に関わり続けれたことを嬉しく思います。次の10年では、文脈や感情のより精緻な表現、超低遅延な対話、ロボットとの統合など、さらなる飛躍が待ち受けているはずです。音声AIが切り拓くこれからの未来に、大いに期待しています 🚀
    @kastnerkyleRT @heiga_zen: 【音声合成技術の10年:WaveNetからマルチモーダルLLMへ】…
    @nalkalcRT @sedielem: 10 years today since we unveiled WaveNet! Autoregression with long context before it was cool😅 Maybe it looks a bit silly n…