TY - RPRT TI - Learning diverse attacks on large language models for robust red-teaming and safety tuning AU - Seanie Lee AU - Minsu Kim AU - Lynn Cherif AU - David Dobre AU - Juho Lee AU - Sung Ju Hwang AU - Kenji Kawaguchi AU - Gauthier Gidel AU - Yoshua Bengio AU - Esmeralda S. Whitammer AU - Moksh Jain PY - 2026 UR - https://arxiv.org/abs/2405.18540 ID - 2405.18540 ER -