数据工程与准备
涵盖数据层面的构建、清洗与格式化,是模型训练的前置基础
数据工程与准备—数据集描述
**数据工程与准备—**SFT 数据构建
数据工程与准备—评测集设计
**数据工程与准备—**反馈闭环
模型微调与参数高效适配(PEFT)
涵盖监督微调(SFT)及各类低资源适配技术(LoRA / Multi-LoRA),是模型领域化的核心手段
**模型微调与参数高效适配—**Soft Prompts
模型微调与参数高效适配—LLaMA-Factory 指南
模型微调与参数高效适配—Qwen2.5-7B-Instruct LoRA 微调
模型微调与参数高效适配—LoRA
人类对齐与强化学习(RLHF)
涵盖基于人类反馈的模型对齐技术,用于提升模型安全性与指令遵循能力
人类对齐与强化学习—RLHF
人类对齐与强化学习—DPO直接偏好优化
**人类对齐与强化学习—**PPO原理与源码解读
**人类对齐与强化学习—**GRPO
人类对齐与强化学习—On-Policy与Off-Policy
**人类对齐与强化学习—**ORPO