@misc{indiciae25e710c24188, title = {Evaluating Large Language Model Raters for German Open-Response Clinical Questions: A Physician-Annotated Benchmark Study of Agreement, Evaluator Bias, and Abstention}, author = {William Philipp and Finn Fassbender and Daniel Fister and Thorsten Langer and Martje G. Pauly and Rebecca Herzog and Markus A. Hobert and Theresa Paulus and Alexander Baumann and Chi Wang Ip and Lukas L. Goede and Johanna Reimer and Sebastian Löns and Ronald Böck and Sebastian Fudickar}, year = {2026}, url = {https://arxiv.org/abs/2607.01103}, note = {Source identifier: 2607.01103} }