有些模型譬如Meta的Code Llama-Instruct是用Supervised Learning再加RLHF。

請您先登陸,再發跟帖!