99% fewer false alarms, catching every egregious failure in the test set I build systems that decide whether AI is safe enough for millions of usersLLM evaluation and AI safety with a background in causal inference. Formerly Trust, Safety, & Quality research lead at a Series B AI startup. Resume 8M users covered by my team’s evaluators Get in Touch #1 ranking of our platform in KORA's child safety benchmark 2 doctorates—economics (Chicago), engineering (Columbia)