# PKU-Alignment/safe-rlhf

Safe RLHF: Constrained Value Alignment via Safe Reinforcement Learning from Human Feedback

Repository: https://github.com/PKU-Alignment/safe-rlhf
Canonical: https://ross.abutalabs.com/products/safe-rlhf
Homepage: https://pku-beaver.github.io
Language: Python
License: Apache-2.0
License Family: permissive
Topics: ai-safety, alpaca, datasets, deepspeed, large-language-models, llama, llm, llms, reinforcement-learning, reinforcement-learning-from-human-feedback, rlhf, transformers, vicuna, safe-rlhf, safe-reinforcement-learning, safe-reinforcement-learning-from-human-feedback, safety, gpt, transformer, beaver
Last push: 2025-11-24T04:07:51+00:00

## Health v2 (maintenance only)
Score: 53/100 (v2, computed 2026-09-02T17:46:02.011165+00:00)
- activity 53, release rhythm 35, longevity 86
- inputs: {"age_days": 1206, "days_push": 282, "days_rel": null, "gap_med": null, "n_releases_24m": 0}
- flags: no_releases
- formula: round(0.45*activity + 0.35*rhythm + 0.20*longevity); archived -> min(score, 10)

## Adoption (not part of the score)
Stars 1611, forks 133 (observed 2026-08-28T04:05:10.965034+00:00)

## What it is
Beaver is a modular open-source framework from Peking University for training large language models with SFT, RLHF, and Safe RLHF (constrained reward maximization). It includes a large human-labeled preference dataset (up to 1M pairs) and pre-trained reward/cost model checkpoints.

## Use cases
- train an LLM with RLHF
- align a language model with safety constraints
- run supervised fine-tuning on LLaMA or OPT
- train a reward model from human preferences
- train a cost model for harmlessness
- research safe reinforcement learning from human feedback
- evaluate LLM safety with BIG-bench or GPT-4 evaluation

## When to choose
- you need a reproducible RLHF or Safe RLHF training pipeline
- you want human-labeled helpfulness and harmlessness preference data
- you are doing alignment research with reward and cost models
- you want pre-trained aligned model checkpoints like Beaver-7B

## When to avoid
- you only need to run inference on an existing LLM
- you lack multi-GPU resources for large model training
- you need a general-purpose RL library unrelated to LLM alignment

## Facets
- artifact type: framework
- maturity: active
- function: llm-training, machine-learning, deep-learning, rag
- domain: large-language-models, machine-learning, artificial-intelligence, deep-learning
- platform: python
- tags: rlhf, safe-rlhf, alignment, ai-safety, reward-model, cost-model, sft, deepspeed, preference-learning, llm-alignment, gpu, linux

## Member repositories
- PKU-Alignment/safe-rlhf (main) score 53

## Provenance
- Observed fields: from GitHub, fetched 2026-08-28T04:05:10.965034+00:00.
- Health v2: computed from the inputs above; adoption is never an input.
- Inferred fields (summary, facets, guidance): AI-extracted, prompt v1, taxonomy v1, on 2026-08-30T03:51:11.218352+00:00, confidence not recorded.
  - readme: https://github.com/PKU-Alignment/safe-rlhf (fetched 2026-08-28T04:05:10.965034+00:00, sha 0f1ee9303a3c)
  - homepage: https://pku-beaver.github.io (fetched 2026-08-29T11:23:08.713632+00:00, sha df9592ac827c)
- Data as of 2026-08-30T08:39:29.467469+00:00.
