数据工程与准备

涵盖数据层面的构建、清洗与格式化,是模型训练的前置基础

数据工程与准备—数据集描述

**数据工程与准备—**SFT 数据构建

数据工程与准备—评测集设计

**数据工程与准备—**反馈闭环

模型微调与参数高效适配(PEFT)

涵盖监督微调(SFT)及各类低资源适配技术(LoRA / Multi-LoRA),是模型领域化的核心手段

**模型微调与参数高效适配—**Soft Prompts

模型微调与参数高效适配—LLaMA-Factory 指南

模型微调与参数高效适配—Qwen2.5-7B-Instruct LoRA 微调

模型微调与参数高效适配—LoRA

人类对齐与强化学习(RLHF)

涵盖基于人类反馈的模型对齐技术,用于提升模型安全性与指令遵循能力

人类对齐与强化学习—RLHF

人类对齐与强化学习—DPO直接偏好优化

**人类对齐与强化学习—**PPO原理与源码解读

**人类对齐与强化学习—**GRPO

人类对齐与强化学习—On-Policy与Off-Policy

**人类对齐与强化学习—**ORPO