On demand

Beyond Benchmarks: Evaluating Agents Against What They Are Actually Supposed to Do

Hosted by TestMu AI

On-demand TestMu Conf 2026 session with Francesca Lazzeri on evaluating AI agents beyond standard benchmarks. 31 minutes; originally presented Aug 19, 2026.

Watch the recording →
When
Watch any time
Format
On demand
Speaker
Francesca Lazzeri
For
ML practitioners
agent evaluationai agentsbenchmarksllm evaluation