Log-Probability Guided Adversarial Attacks on Multi-Agent LLM Debate

F. Niyigaba*, S. A. Haider*, N. Singh
Manuscript in preparation · January 2026 · adversarial-robustness

A novel log-probability attack surface succeeds on frontier models where prior methods fail; +26% attack success on GPT-3.5 over prior baselines.