DailyUpdated 2026-09-19 12:21 UTC0 articles
Evals & reliability
Evaluation, benchmarks, observability, guardrails, reliability of agentic systems
Live signals on Evals & reliability
- SAFARI: An Industrial Benchmark for LLM-Assisted Hazard Analysis and Risk Assessment arXiv · 2 days ago · frontier 83%
- Chronicle: Cut-Point Replay for Regression Testing of LLM Agents arXiv · 2 days ago · frontier 86%
- Quantifying Overclaiming Propensity in Frontier LLM Agents arXiv · 1 days ago · frontier 79%
- PosteriorBench: From Point Estimates to Posterior Matching in Evaluating Generative Inverse Solvers arXiv · 1 days ago · frontier 81%
- Harm Laundering in GPT Models: Evidence That Gender Discrimination Is Transformed Rather Than Reduced Across… arXiv · 1 days ago · frontier 76%
- Prediction-Powered Smoothing and Validation for Disaggregated AI Evaluation arXiv · 1 days ago · frontier 69%
- HerHealthEval: Evaluating Multilingual and Register-Sensitive Understanding of Women's Health Communication arXiv · 2 days ago · frontier 60%
- Language-model groups overstate consensus when replaying human deliberation on a reasoning task arXiv · 2 days ago · frontier 43%