for years, agent observability meant spending weeks making eval sets that break every time a new model comes out. ~1 year ago,
@raindrop_aiintroduced a better way - tiny classifiers that detect anomalies in user/agent interactions. but a lot has changed since then.