TY - RPRT TI - Benchmarking large language model agent societies against human behavioural distributions AU - Raad Bin Tareaf PY - 2026 UR - https://arxiv.org/abs/2608.28182 ID - 2608.28182 ER -