UnfaithRL/Qwen2.5-0.5B-hint_following_reward_faithful_prompt-2048 Reinforcement Learning • 0.5B • Updated 13 days ago • 33
UnfaithRL/Qwen2.5-0.5B-hint_following_reward_faithful_prompt-1024 Reinforcement Learning • 0.5B • Updated 13 days ago • 39
UnfaithRL/Qwen2.5-0.5B-hint_following_reward_faithful_prompt-512 Reinforcement Learning • 0.5B • Updated 13 days ago • 39
UnfaithRL/OLMo-2-0425-1B-hint_following_reward_faithful_prompt-2048 Reinforcement Learning • 1B • Updated 13 days ago • 39
UnfaithRL/OLMo-2-0425-1B-hint_following_reward_faithful_prompt-1024 Reinforcement Learning • 1B • Updated 13 days ago • 39
UnfaithRL/OLMo-2-0425-1B-hint_following_reward_faithful_prompt-512 Reinforcement Learning • 1B • Updated 13 days ago • 39
UnfaithRL/Qwen2.5-0.5B-Instruct-hint_verbalization_reward_strict_v2-2048 Reinforcement Learning • 0.5B • Updated 13 days ago • 62
UnfaithRL/Qwen2.5-0.5B-Instruct-hint_verbalization_reward_strict_v2-1024 Reinforcement Learning • 0.5B • Updated 13 days ago • 63
UnfaithRL/Qwen2.5-0.5B-Instruct-hint_verbalization_reward_strict_v2-512 Reinforcement Learning • 0.5B • Updated 13 days ago • 79
UnfaithRL/OLMo-2-0425-1B-Instruct-hint_verbalization_reward_strict_v2-2048 Reinforcement Learning • 1B • Updated 13 days ago • 58
UnfaithRL/OLMo-2-0425-1B-Instruct-hint_verbalization_reward_strict_v2-1024 Reinforcement Learning • 1B • Updated 13 days ago • 57
UnfaithRL/OLMo-2-0425-1B-Instruct-hint_verbalization_reward_strict_v2-512 Reinforcement Learning • 1B • Updated 13 days ago • 66
UnfaithRL/Qwen2.5-0.5B-hint_verbalization_reward_strict_v9-2048 Reinforcement Learning • 0.5B • Updated 13 days ago • 36
UnfaithRL/Qwen2.5-0.5B-hint_verbalization_reward_strict_v9-1024 Reinforcement Learning • 0.5B • Updated 13 days ago • 40
UnfaithRL/Qwen2.5-0.5B-hint_verbalization_reward_strict_v9-512 Reinforcement Learning • 0.5B • Updated 13 days ago • 31
UnfaithRL/OLMo-2-0425-1B-hint_verbalization_reward_strict_v9-2048 Reinforcement Learning • 1B • Updated 13 days ago • 34
UnfaithRL/OLMo-2-0425-1B-hint_verbalization_reward_strict_v9-1024 Reinforcement Learning • 1B • Updated 13 days ago • 39
UnfaithRL/OLMo-2-0425-1B-hint_verbalization_reward_strict_v9-512 Reinforcement Learning • 1B • Updated 13 days ago • 37
UnfaithRL/Qwen2.5-0.5B-hint_verbalization_reward_relaxed_v7-2048 Reinforcement Learning • 0.5B • Updated 13 days ago • 64
UnfaithRL/Qwen2.5-0.5B-hint_verbalization_reward_relaxed_v7-1024 Reinforcement Learning • 0.5B • Updated 13 days ago • 55
UnfaithRL/Qwen2.5-0.5B-hint_verbalization_reward_relaxed_v7-512 Reinforcement Learning • 0.5B • Updated 13 days ago • 76
UnfaithRL/OLMo-2-0425-1B-hint_verbalization_reward_relaxed_v7-2048 Reinforcement Learning • 1B • Updated 13 days ago • 59
UnfaithRL/OLMo-2-0425-1B-hint_verbalization_reward_relaxed_v7-1024 Reinforcement Learning • 1B • Updated 13 days ago • 62
UnfaithRL/OLMo-2-0425-1B-hint_verbalization_reward_relaxed_v7-512 Reinforcement Learning • 1B • Updated 13 days ago • 69
UnfaithRL/Qwen2.5-0.5B-hybrid_accuracy_hint_reward-2048 Reinforcement Learning • 0.5B • Updated 13 days ago • 37
UnfaithRL/Qwen2.5-0.5B-hybrid_accuracy_hint_reward-1024 Reinforcement Learning • 0.5B • Updated 13 days ago • 33
UnfaithRL/Qwen2.5-0.5B-hybrid_accuracy_hint_reward-512 Reinforcement Learning • 0.5B • Updated 13 days ago • 31
UnfaithRL/OLMo-2-0425-1B-hybrid_accuracy_hint_reward-2048 Reinforcement Learning • 1B • Updated 13 days ago • 39
UnfaithRL/OLMo-2-0425-1B-hybrid_accuracy_hint_reward-1024 Reinforcement Learning • 1B • Updated 13 days ago • 37
UnfaithRL/OLMo-2-0425-1B-hybrid_accuracy_hint_reward-512 Reinforcement Learning • 1B • Updated 13 days ago • 39