, Nelleke Oostdijk (dir. tes.)
, Patricia Martín-Rodilla (dir. tes.) 
, David Enrique Losada Carril (secret.)
, Elisabetta Fersini (voc.) 
La adopción generalizada de las redes sociales ha transformado la comunicación pública al permitir la producción y difusión de contenidos a una escala sin precedentes. Estos contenidos generados por usuarios incluyen opiniones, reacciones y debates sobre cuestiones socialmente relevantes. Sin embargo, el mismo carácter abierto de estas plataformas también facilita la aparición y propagación de contenido dañino, incluido el discurso de odio. En estos entornos, su impacto puede amplificarse: el alcance y la velocidad de difusión aumentan significativamente, y el anonimato percibido puede favorecer expresiones más agresivas o explícitas. A la vez, la detección del discurso de odio sigue siendo una tarea compleja, ya que puede ser explícito o implícito, directo o codificado, y depende fuertemente del contexto social, cultural y conversacional. Esta combinación de escala, impacto y complejidad lingüística ha convertido su detección automática en un reto central de la moderación de contenidos. Los avances recientes en Natural Language Processing (NLP), especialmente en los Large Language Models (LLMs), abren nuevas posibilidades para abordar este problema mediante la modelización de patrones lingüísticos complejos. Esto ha impulsado un creciente interés en sistemas automáticos de detección capaces de operar a gran escala en entornos reales. Pese a los avances recientes basados en datos diversos y modelos cada vez más potentes, persisten varios retos. En primer lugar, las diferencias en la construcción y anotación de los conjuntos de datos dificultan la generalización entre dominios y definiciones de discurso de odio. En segundo lugar, el alto coste computacional de los modelos más avanzados limita su despliegue en escenarios reales de moderación a gran escala. En tercer lugar, la falta de transparencia de muchos sistemas dificulta la comprensión y validación de sus decisiones. Estos problemas son especialmente relevantes en entornos dinámicos, donde el contenido evoluciona constantemente y los sistemas deben adaptarse. Esta tesis aborda estos retos mediante el desarrollo de sistemas de detección que buscan equilibrar precisión, eficiencia, interpretabilidad y adaptabilidad.
Las contribuciones se organizan en cuatro áreas. La primera trata la construcción de recursos de datos a gran escala. MetaHate unifica múltiples conjuntos de datos en inglés en una metacolección, junto con un análisis lingüístico que identifica patrones léxicos, temáticos y psicolingüísticos que distinguen el contenido de odio. MetaHateES extiende este trabajo a lenguas ibéricas, creando la primera meta-colección multilingüe para español, portugués europeo y gallego, con datos sintéticos y análisis cruzado entre lenguas y traducciones. La segunda área desarrolla modelos más eficientes y adaptativos. Se explora KD para transferir capacidades de razonamiento de grandes LLMs a modelos más pequeños sin perder calidad explicativa. Sobre esta base, THOR introduce aprendizaje por refuerzo con GRPO para alinear razonamiento y clasificación, mostrando mejoras frente a modelos más grandes basados solo en prompting. Además, el enfoque RAICL incorpora recuperación de ejemplos relevantes en inferencia para adaptarse a la deriva conceptual sin reentrenamiento. La tercera área analiza sesgos y limitaciones de los LLMs en la detección de contenido dañino. Una auditoría de modelos actuales muestra gran variabilidad en sus respuestas ante discurso de odio y evalúa estrategias de salva guardado y ajuste fino para reducir generación tóxica. Un estudio sobre sesgo geográfico y lingüístico evidencia que la contextualización por país degrada el rendimiento, y propone Debias Tuning para mejorar la robustez entre contextos. También se estudia la fiabilidad de la anotación bajo subjetividad, mostrando que los LLMs pueden servir como evaluadores consistentes a nivel agregado. Por último, un análisis de toma de perspectiva muestra que el prompting vicario reproduce mejor la diversidad de juicios humanos que la simple asignación de identidades. La cuarta área integra estos avances en un sistema unificado. WATCHED es un marco de moderación basado en agentes que combina un clasificador de discurso de odio, un módulo de recuperación de ejemplos y recursos léxicos, un modelo de razonamiento destilado y un componente de alineación con políticas de redes sociales, generando decisiones interpretables y apoyadas en evidencia con retroalimentación humana.
En conjunto, esta tesis contribuye a la detección de discurso de odio en tres frentes: ampliación de datos mediante recursos multilingües unificados, mejora de eficiencia mediante destilación y aprendizaje por refuerzo en modelos compactos, y aumento de la transparencia mediante razonamiento explícito, recuperación de contexto y evaluación sensible a la subjetividad. El resultado es un enfoque más eficiente, robusto e interpretable para la moderación de contenidos a gran escala.
The widespread adoption of online social networks has transformed public communication by enabling users to produce and disseminate content at an unprecedented scale. This user-generated content often takes the form of opinions, reactions, and discussions around socially relevant issues. Yet, the same openness that supports public participation also facilitates the emergence and diffusion of harmful content, including hate speech. In online settings, hate speech can have an amplified impact: social platforms increase its potential reach and speed of dissemination, while perceived anonymity may contribute to more aggressive and explicit forms of expression. At the same time, detecting hate speech remains a complex task, since harmful messages may be explicit or implicit, direct or coded, and often depend on social, cultural, and conversational context. This combination of scale, impact, and linguistic complexity has made automated detection a central challenge for online content moderation. Recent advances in Natural Language Processing (NLP), particularly Large Language Models (LLMs), provide a timely opportunity to address this challenge by modelling nuanced linguistic patterns more effectively. Consequently, these developments have driven increasing interest in automated hate speech detection systems designed to operate at scale in real-world environments. Although recent approaches have advanced hate speech detection through the use of diverse datasets and increasingly powerful models, several challenges remain. First, differences in dataset construction and annotation schemes complicate the development of systems that generalise across domains and definitions of hate speech. Second, the high computational cost of state-of-the-art models can limit their practical deployment in large-scale moderation scenarios. Third, the limited transparency of many detection systems makes it difficult to understand, validate, and trust their decisions. These issues are especially relevant in dynamic online environments, where harmful content changes over time and detection systems must adapt accordingly. This thesis addresses these challenges by developing hate speech detection systems that aim to combine accuracy with efficiency, interpretability, and adaptability to evolving online contexts. The contributions of this thesis are organised across four thematic areas.
The first concerns the construction of large-scale data resources for hate speech detection. MetaHate consolidates dozens of publicly available English datasets into a unified meta-collection, accompanied by a linguistic analysis identifying consistent lexical, topical, and psycholinguistic patterns that distinguish hateful from non-hateful content. MetaHateES extends this effort to Iberian languages, constructing the first large-scale cross-lingual benchmark covering Spanish, European Portuguese, and Galician, augmented with synthetic data generation and cross-lingual analysis. of how hate speech dimensions are preserved across translations and lowresource language varieties.
The second area develops parameter-efficient and adaptive modelling strategies that retain reasoning capabilities while reducing computational requirements. Knowledge Distillation (KD) is explored as a means of transferring the reasoning and classification capabilities of large teacher LLMs into smaller, deployable student models without sacrificing explanation quality. Building on this, THOR introduces a reinforcement learning framework via Group Relative Policy ptimisation (GRPO) that explicitly aligns reasoning with classification objectives, showing that structured reasoning optimisation can outperform much larger models that rely on prompting alone. This area is completed by a Retrieval-Augmented In-Context Learning (RAICL) approach that retrieves semantically relevant examples at inference time to handle concept drift, enabling adaptation to evolving hate speech patterns without retraining.
The third area analyses and mitigates biases and vulnerabilities in LLMs when handling harmful content. An audit of state-of-the-art LLMs reveals substantial variation in how models respond to hate speech in open-ended interactions, and evaluates the effectiveness of guardrailing and fine-tuning strategies to prevent toxic generation. A dedicated study on geographic and linguistic bias shows that country-specific contextualisation systematically degrades classification performance, and proposes a Debias Tuning strategy to restore cross-context robustness. Annotation reliability is further examined under a subjectivity-aware framework, showing that LLMs can serve as scalable proxy evaluators for model comparison even when they diverge from human annotators at the instance level. Finally, a study on demographic perspective-taking evaluates whether persona-conditioned LLMs can reproduce the structure of human disagreement in hate speech perception, finding that vicarious prompting offers a more reliable path towards human-aligned annotation than standard identity conditioning.
The fourth area integrates these contributions into a unified operational system. WATCHED is an agent-based moderation framework that coordinates a hate speech classifier, a retrieval module for similar posts and lexical resources, a distilled reasoning model, and a social network policy grounding tool, producing interpretable and evidence-based decisions with a human-in-the-loop feedback mechanism. Taken together, the contributions of this thesis advance hate speech detection along three dimensions: data coverage is broadened through large-scale, multilingual consolidation of existing resources; computational efficiency is improved through distillation and reinforcement learning pipelines that enable compact models to match or exceed the performance of much larger systems; and transparency is enhanced through explicit reasoning traces, retrieval-based adaptation, and subjectivity-aware evaluation. The result is a moderation framework that is more accurate, efficient, and interpretable than existing approaches, providing a foundation for scalable and responsible content moderation systems.
A adopción xeneralizada das redes sociais transformou a comunicación pública ao permitir a produción e difusión de contidos a unha escala sen precedentes. Estes contidos xerados por usuarios inclúen opinións, reacción e debates sobre cuestións socialmente relevantes. Con todo, o mesmo carácter aberto destas plataformas tamén facilita a aparición e propagación de contido daniño, incluído o discurso de odio. Nestes contornos, o seu impacto pode amplificarse: o alcance e a velocidade de difusión aumentan significativamente, e o anonimato percibido pode favorecer expresión máis agresivas ou explícitas. Á vez, a detección do discurso de odio segue sendo unha tarefa complexa, xa que pode ser implícito ou explícito, directo ou codificado, e depende fortemente do contexto social, cultural e conversacional. Esta combinación de escala, impacto e complexidade lingüística converteu a súa detección automática nun reto central da moderación de contidos. Os recentes avances en Natural Language Processing (NLP), especialmente nos Large Language Models (LLMs), abren novas posibilidades para abordar este problema mediante a modelización de patróns lingüísticos complexos. Isto impulsou un crecente interese en sistemas automáticos de detección capaces de operar a gran escala en contornas reais. A pesar dos recentes avances baseados en datos diversos e modelos cada vez máis potentes, persisten varios retos. En primeiro lugar, as diferenzas na construción e anotación dos conxuntos de datos dificultan a xeneralización entre dominios e definicións de discurso de odio. En segundo lugar, o alto custo computacional dos modelos máis avanzados limita o seu despregamento en escenarios reais de moderación a gran escala. En tercero lugar, a falta de transparencia de moitos sistemas dificulta a comprensión e validación das súas decisións. Estes problemas son especialmente relevantes en contornas dinámicas, onde o contido evoluciona constantemente e os sistemas deben adaptarse. Esta tese aborda estes retos mediante o desenvolvemento de sistemas de detección que buscan equilibrar precisión, eficiencia, interpretabilidade e adaptabilidade.
As contribucións organízanse en catro áreas. A primeira retírese á construcción de recursos de datos en larga escala. MetaHate unifica múltiples conxuntos de datos en inglés nunha metacolección, xunto cunha análise lingüística que identifica patróns léxicos, temáticos e psicolingüísticos que distinguen o contido de odio. MetaHateES estende este traballo a linguas ibéricas, creando a primeira meta-colección multilingüe para español, portugués europeo e galego, con datos sintéticos e análise cruzado entre linguas e traducións. A segunda área desenvolve modelos máis eficientes e adaptativos. Explórase. KD para transferir capacidades de razoamento de grandes LLMs a modelos máis pequenos sen perder calidade explicativa. Sobre esta base, THOR introduce introduce aprendizaxe por reforzo con GRPO para aliñar razoamento e clasificación, mostrando melloras fronte a modelos máis grandes baseados só en prompting. Ademais, o enfoque RAICL incorpora incorpora recuperación de exemplos relevantes en inferencia para adaptarse á deriva conceptual sen readestramento. A terceira área analiza sesgos e limitacións dos LLMs na detección de contido daniño. Unha auditoría de modelos actuais mostra gran variabilidade nas súas respostas ante discurso de odio e avalía estratexias de salva gardado e axuste fino para reducir xeración tóxica. Un estudo sobre nesgo xeográfico e lingüístico evidencia que a contextualización por país degrada o rendemento, e propón Debias Tuning para mellorar a robustez entre contextos. Tamén se estuda a fiabilidade da anotación baixo subxectividade, mostrando que os LLMs poden servir como avaliadores consistentes a nivel agregado. Por último, unha análise de toma de perspectiva mostra que o prompting vicario reproduce mellor a diversidade de xuízos humanos que a simple asignación de identidades. A cuarta área integra estes avances nun sistema unificado. WATCHED é un marco de moderación baseado en axentes que combina un clasificador de discurso de odio, un módulo de recuperación de exemplos e recursos léxicos, un modelo de razoamento destilado e un compoñente de aliñación con políticas de redes sociais, xerando decisións interpretables e apoiadas en evidencia con retroalimentación humana.
En conxunto, esta tese contribúe á detección de discurso de odio en tres frontes: ampliación de datos mediante recursos multilingües unificados, mellora de eficiencia mediante destilación e aprendizaxe por reforzo en modelos compactos, e aumento da transparencia mediante razoamento explícito, recuperación de contexto e avaliación sensible á subxectividade. O resultado é un enfoque máis eficiente, robusto e interpretable para a moderación de contidos a gran escala.
© 2008-2026 Fundación Dialnet · Todos los derechos reservados