Modelpedia
Work in progress
About
Findings
Models
Concepts
Methods
Datasets
Sources
Light
Dark
DailyDilemmas: Revealing Value Preferences of LLMs with Quandaries of Daily Life
2025-01-22
· ICLR 2025 Spotlight ·
anchor
Findings
IC-230
Six LLMs show distinct value preferences on daily-life moral dilemmas, with significant inter-model differences on core values such as truthfulness and fairness
IC-231
GPT-4-turbo and Claude-3-Haiku show inconsistent adherence to their providers' stated design principles when facing value conflicts in daily-life dilemmas
IC-232
System prompts cannot effectively steer GPT-4-turbo's value preferences in moral dilemmas
IC-233
Llama-3-70B instruct model differs from its base model in emotion preferences but not in cultural preferences, indicating post-training (RLHF) shapes emotional values