GRPO là phương pháp học tăng cường được giới thiệu trong DeepSeekMath, sử dụng kết quả của một nhóm đầu ra để xây dựng tín hiệu cập nhật chính sách. Phương pháp gốc đánh giá phần thưởng tương đối trong nhóm và giảm nhu cầu dùng một mô hình giá trị riêng so với cách triển khai PPO thông thường.
« Quay trở lại Từ điểnGRPO
« Quay trở lại Từ điển