TY - RPRT TI - What AI Benchmarks Actually Measure: Adapting Convergent and Discriminant Validity to Interrogate Fifty-Six AI Benchmarks AU - Meera Desai AU - Sang T. Truong AU - Hanna Wallach AU - Alex Chouldechova AU - A. Feder Cooper AU - Jean Garcia-Gathright AU - Daniel E. Ho AU - Abigail Z. Jacobs AU - Sanmi Koyejo AU - Nicholas Pangakis AU - Angelina Wang PY - 2026 UR - https://arxiv.org/abs/2609.08812 ID - 2609.08812 ER -