TY - RPRT TI - Evaluating Large Language Model Raters for German Open-Response Clinical Questions: A Physician-Annotated Benchmark Study of Agreement, Evaluator Bias, and Abstention AU - William Philipp AU - Finn Fassbender AU - Daniel Fister AU - Thorsten Langer AU - Martje G. Pauly AU - Rebecca Herzog AU - Markus A. Hobert AU - Theresa Paulus AU - Alexander Baumann AU - Chi Wang Ip AU - Lukas L. Goede AU - Johanna Reimer AU - Sebastian Löns AU - Ronald Böck AU - Sebastian Fudickar PY - 2026 UR - https://arxiv.org/abs/2607.01103 ID - 2607.01103 ER -