Initial commit
This commit is contained in:
@@ -0,0 +1,11 @@
|
||||
//! RLHF (Reinforcement Learning from Human Feedback) implementation
|
||||
|
||||
mod ppo_trainer;
|
||||
mod preference_dataset;
|
||||
mod reward_model;
|
||||
mod rlhf_trainer;
|
||||
|
||||
pub use ppo_trainer::{PPOConfig, PPOMetrics, PPOTrainer};
|
||||
pub use preference_dataset::{PreferenceDataset, PreferencePair};
|
||||
pub use reward_model::{RewardModel, RewardModelConfig};
|
||||
pub use rlhf_trainer::{RLHFConfig, RLHFTrainer, RewardMetrics};
|
||||
Reference in New Issue
Block a user