Berdejo-Espinola, V., Hajas, A., Cornford, R., Ye, N. & Amano, T. (2025) Spanish-language text classification for environmental evidence synthesis using multilingual pre-trained models. Environmental Evidence 14: 21.
A persistent challenge in environmental evidence syntheses is that these remain predominantly monolingual (English), leading to biased results and misinforming cross-scale policy decisions. We trained supervised machine learning models using a corpus of Spanish-language peer-reviewed academic articles on biodiversity conservation. The best-performing model achieved a recall of 100%, meaning it missed no relevant articles, while filtering out over 70% of irrelevant documents based solely on titles and abstracts.
