Categories
October Surprise 2024

MAPS: A Multilingual Benchmark for Agent Performance and Security

We translate each dataset into eleven diverse languages, resulting in 805 unique tasks and 9,660 total language-specific instances – enabling a systematic analysis of the Multilingual Effect on AI agents’ performance and robustness.