Initial commit

This commit is contained in:
redclawsystems
2026-03-04 00:08:42 +00:00
commit 4d88dc0584
4449 changed files with 1556714 additions and 0 deletions
+11
View File
@@ -0,0 +1,11 @@
//! RLHF (Reinforcement Learning from Human Feedback) implementation
mod ppo_trainer;
mod preference_dataset;
mod reward_model;
mod rlhf_trainer;
pub use ppo_trainer::{PPOConfig, PPOMetrics, PPOTrainer};
pub use preference_dataset::{PreferenceDataset, PreferencePair};
pub use reward_model::{RewardModel, RewardModelConfig};
pub use rlhf_trainer::{RLHFConfig, RLHFTrainer, RewardMetrics};