Edit Models filters

Tasks

Text Generation

Image-Text-to-Text

Parameters

Libraries

Transformers.js

Apps

Inference Providers

Models

1,036

Full-text search

Active filters: reinforcement-learning, transformers

NousResearch/DeepHermes-Egregore-v1-RLAIF-8b-Atropos-GGUF

Reinforcement Learning • 8B • Updated May 5 • 47 • 3

ajagota71/pythia-70m-detox-test

Reinforcement Learning • 0.1B • Updated May 4 • 28

ajagota71/pythia-70m-detox-raw-logits

Reinforcement Learning • 0.1B • Updated May 4 • 29

NousResearch/DeepHermes-AscensionMaze-RLAIF-8b-Atropos-GGUF

Reinforcement Learning • 0.0B • Updated May 10 • 62 • 6

mradermacher/SEOcrate-4B_grpo_new_01-i1-GGUF

Reinforcement Learning • 4B • Updated 18 days ago • 4.82k

ajagota71/pythia-70m-detox-irl-rlhf-test

Reinforcement Learning • 0.1B • Updated May 7 • 30

Nellyw888/VeriReason-Qwen2.5-7b-RTLCoder-Verilog-GRPO-reasoning-tb

Reinforcement Learning • 8B • Updated May 31 • 871 • 4

vegeta03/DeepHermes-Egregore-v2-RLAIF-8b-Atropos-Q8_0-GGUF

Reinforcement Learning • 8B • Updated May 9 • 9

vegeta03/DeepHermes-AscensionMaze-RLAIF-8b-Atropos-Q8_0-GGUF

Reinforcement Learning • 8B • Updated May 9 • 6

vegeta03/DeepHermes-ToolCalling-Specialist-Atropos-Q8_0-GGUF

Reinforcement Learning • 8B • Updated May 9 • 10

ajagota71/pythia-70m-detox-irl-rlhf-test-facebook-filter

Reinforcement Learning • 0.1B • Updated May 11 • 30

ajagota71/pythia-70m-detox-irl-rlhf-test2

Reinforcement Learning • 0.1B • Updated May 11 • 28

ajagota71/pythia-70m-detox-raw-logits-test2

Reinforcement Learning • 0.1B • Updated May 11 • 28

ajagota71/pythia-160m-detox-raw-logits-test2

Reinforcement Learning • 0.2B • Updated May 11 • 13

ajagota71/pythia-70m-detox-irl-rlhf-seed-42

Reinforcement Learning • 0.1B • Updated May 11 • 13

ajagota71/pythia-70m-detox-irl-rlhf-seed-200

Reinforcement Learning • 0.1B • Updated May 11 • 30

ajagota71/pythia-410m-detox-irl-rlhf-seed-42

Reinforcement Learning • 0.4B • Updated May 11 • 24

ajagota71/pythia-410m-detox-irl-rlhf-seed-100

Reinforcement Learning • 0.4B • Updated May 11 • 13

ajagota71/pythia-410m-detox-irl-rlhf-seed-200

Reinforcement Learning • 0.4B • Updated May 11 • 13

ajagota71/pythia-410m-detox-irl-rlhf-seed-300

Reinforcement Learning • 0.4B • Updated May 12 • 3

ajagota71/pythia-410m-detox-irl-rlhf-seed-400

Reinforcement Learning • 0.4B • Updated May 12 • 24

Nellyw888/VeriReason-codeLlama-7b-RTLCoder-Verilog-GRPO-reasoning-tb

Reinforcement Learning • 7B • Updated May 31 • 835 • 2

Arrebol-yzq/RLP_llm_inductive_model

Reinforcement Learning • Updated May 14 • 1

Nellyw888/VeriReason-Qwen2.5-3b-RTLCoder-Verilog-GRPO-reasoning-tb

Reinforcement Learning • 3B • Updated May 31 • 27

Nellyw888/VeriReason-Qwen2.5-1.5b-RTLCoder-Verilog-GRPO-reasoning-tb

Reinforcement Learning • 2B • Updated May 20 • 38 • 1

ajagota71/pythia-70m-fb-detox-checkpoint-epoch-20

Reinforcement Learning • 0.1B • Updated May 16 • 3

ajagota71/pythia-70m-fb-detox-checkpoint-epoch-40

Reinforcement Learning • 0.1B • Updated May 16 • 3

ajagota71/pythia-70m-fb-detox-checkpoint-epoch-60

Reinforcement Learning • 0.1B • Updated May 16 • 20

ajagota71/pythia-70m-fb-detox-checkpoint-epoch-80

Reinforcement Learning • 0.1B • Updated May 16 • 3

ajagota71/pythia-70m-fb-detox-checkpoint-epoch-100

Reinforcement Learning • 0.1B • Updated May 16 • 3