• Home
  • Technology
  • Gaming
  • Entertainment
  • World & Business
  • Science
  • Sports
  • AI
HomeTechnologyGamingEntertainmentWorld & BusinessScienceSportsAI
    • Home
    • Technology
    • Gaming
    • Entertainment
    • World & Business
    • Science
    • Sports
    • AI
    AI
    Announcement

    Calibrated User Embeddings targets a gap in AI-agent tests with simulated users

    The post introducing CUE says simulators can resemble real users without reproducing real evaluation outcomes.

    Graham NeubigGN
    Anjali KantharubanAK
    2 Sources, 5h ago, first seen 5h ago

    TLDR

    The author introduces Calibrated User Embeddings (CUE) to address a gap in how LLM-based user simulators are used to evaluate AI agents across multiple turns. They say a simulator can look like a real user without reproducing real evaluation outcomes.

    Combined views

    3.9K

    2 Sources, first seen 5h ago

    Combined views

    3.9K

    2 Sources, first seen 5h ago

    66 likes
    66 likes
    8 comments
    55 saves
    12 reposts
    Featured Source
    8 comments
    55 saves
    12 reposts

    Sentiment

    Positive——Negative

    Summary

    Not enough discussion yet.

    No sentiment analysis available yet.

    Sentiment

    Positive——Negative

    Summary

    Not enough discussion yet.

    No sentiment analysis available yet.

    Today's Rank

    —

    Not ranked yet

    Today's Rank

    —

    Not ranked yet

    2 Sources

    Anjali Kantharuban@anjali_ruban⚠️ User simulators are increasingly used to evaluate AI agents in multi-turn interaction. But we find that looking like real users ≠ reproducing real evaluation outcomes. 📢 We introduce Calibrated User Embeddings (CUE) to bridge this gap across LLM simulators. 🧵 1/85h
    Graham Neubig@gneubigRT @anjali_ruban: ⚠️ User simulators are increasingly used to evaluate AI agents in multi-turn interaction. But we find that looking like r…3h

    2 Sources

    Anjali Kantharuban@anjali_ruban⚠️ User simulators are increasingly used to evaluate AI agents in multi-turn interaction. But we find that looking like real users ≠ reproducing real evaluation outcomes. 📢 We introduce Calibrated User Embeddings (CUE) to bridge this gap across LLM simulators. 🧵 1/85h
    Graham Neubig@gneubigRT @anjali_ruban: ⚠️ User simulators are increasingly used to evaluate AI agents in multi-turn interaction. But we find that looking like r…3h