On demand
Beyond Benchmarks: Evaluating Agents Against What They Are Actually Supposed to Do
Hosted by TestMu AI
On-demand TestMu Conf 2026 session with Francesca Lazzeri on evaluating AI agents beyond standard benchmarks. 31 minutes; originally presented Aug 19, 2026.
Watch the recording →- When
- Watch any time
- Format
- On demand
- Speaker
- Francesca Lazzeri
- For
- ML practitioners
agent evaluationai agentsbenchmarksllm evaluation