canyuchen/fedagent-alfworld-ppo-hardness-std1-qwen2.5-1.5b Reinforcement Learning • Updated 8 days ago
canyuchen/fedagent-alfworld-ppo-hardness-std1-qwen2.5-1.5b Reinforcement Learning • Updated 8 days ago
canyuchen/fedagent-webshop-grpo-hardness-std1-qwen2.5-1.5b Text Generation • 2B • Updated 11 days ago • 13
canyuchen/fedagent-webshop-grpo-hardness-std1-qwen2.5-1.5b Text Generation • 2B • Updated 11 days ago • 13
MultiBBQ Collection Fairness benchmark for multimodal LLMs: dataset, image perturbations, and results (paper: Fairness Failure Modes of Multimodal LLMs). • 4 items • Updated 23 days ago
MultiBBQ Collection Fairness benchmark for multimodal LLMs: dataset, image perturbations, and results (paper: Fairness Failure Modes of Multimodal LLMs). • 4 items • Updated 23 days ago