Modelpedia
Work in progress
About
Findings
Models
Concepts
Methods
Datasets
Sources
Light
Dark
FairMT-Bench: Benchmarking Fairness for Multi-turn Dialogue in Conversational LLMs
2025-01-22
· ICLR 2025 Spotlight ·
anchor
Findings
IC-242
Most LLMs exhibit higher bias ratios in multi-turn dialogues than in single-turn, with bias accumulating across successive turns
IC-243
Bias ratio on certain multi-turn fairness tasks decreases with model size in the Gemma-2 and Qwen2.5 families
IC-244
No LLM demonstrates consistently strong fairness across both comprehension-focused and bias-resistance multi-turn tasks; models show complementary failure patterns