求職者向けRLHF解説:仕事内容と就き方
RLHFとは、AIモデルが「良い回答」とはどのようなものかを学習するための仕組みです。この記事では、RLHF関連の仕事内容、報酬、そして仕事の就き方について解説します。
RLHFは「人間のフィードバックからの強化学習(reinforcement learning from human feedback)」の略です。これは、人間がAIモデルの回答を評価、比較、修正することで、良い回答とはどのようなものかを教え、人間が高く評価した回答をモデルが優先するように調整するトレーニング段階です。求職者にとって、RLHFは有給のAIトレーニング業務の中で最大のカテゴリーです。OpenTrainでは、募集中の全求人の約3分の1を占めており、そのほとんどがエントリーレベルで、提示されている時給の中央値は$70です。
このガイドでは、RLHFの仕組みを分かりやすく説明し、RLHFの仕事の日常的な様子、どのような人に向いている仕事なのか、そしてその仕事に就く方法について解説します。
3つのステップでわかるRLHFの仕組み
- 教師ありファインチューニング(Supervised fine-tuning) 人間がプロンプトの例と理想的な回答を作成します。モデルはそれらを模倣するようにトレーニングされます。ここでライティングの職種が活躍します。
- 報酬モデリング(Reward modeling) 人間がモデルの回答のペアを比較してより良い方を選ぶか、評価基準(ルーブリック)に沿って回答を採点します。2つ目のモデルである報酬モデルは、そうした人間の好みを予測するように学習します。ここで、評価や比較を行う職種の多くが活躍します。
- 強化学習(Reinforcement learning) AIモデルが多数の回答を生成し、報酬モデルがそれらを採点します。そして、より高得点の回答を生成するようにモデルが調整されます。その後、人間が結果を確認し、このサイクルが繰り返されます。
ステップ1と2における人間の作業が、RLHFの仕事です。モデルは人間が一貫して示す好みしか学習できないため、ガイドラインは詳細に定められており、一貫性が最も重要なスキルとなります。
RLHFの仕事の日常的な様子
一般的な作業セッションは、ウェブツール上のタスクのキュー(待機列)で構成されます。各タスクには、プロンプト、1つ以上のモデルの回答、そして一連の質問が表示されます。よくあるタスクの形式は以下の通りです。
- ペア比較(Pairwise comparison) 1つのプロンプトに対する2つの回答。より良い方を選び、その選択に対する自信の度合いを答えます。
- ルーブリック評価(Rubric scoring) 正確性、有用性、安全性、トーンなどの観点から回答を評価し、その点数の理由を1〜2文で説明します。
- リライト(Rewriting) モデルが書くべきだった理想的な回答を作成します。
- 会話作成(Conversation authoring) 特定のシナリオへの対応方法をモデルに示すため、複数回のやり取りからなる会話を作成します。
- 敵対的プロンプティング(Adversarial prompting) モデルにルールを破らせるようなプロンプトを入力し、その結果どうなったかを記録します。
専門分野の職種でも同じ形式のタスクを使用しますが、回答が正しいかどうかを判断するための専門知識が必要になります。
分野別の募集中のRLHF求人
分野タグが付いたRLHFの求人。分野タグのない一般的な評価の求人は表示されていません。
言語学
48件の求人
生物学
36件の求人
化学
33件の求人
物理学
30件の求人
工学
27件の求人
翻訳およびローカリゼーション
24件の求人
マーケティング
22件の求人
機械学習
20件の求人
機械工学
20件の求人
サイバーセキュリティ
13件の求人
RLHFの求人はどのような人に向いているか
RLHFは、資格よりもスキルが重視されるため、多くの人がAIトレーニングを始める分野です。OpenTrainで募集中の経験レベルが記載されたRLHFの求人のうち、79%がエントリーレベルです。中級またはエキスパートの経験を求める求人は、通常、専門的な技術分野や評価者チームのリーダー職に関連しています。
経験レベル別のRLHFの時給中央値
募集中のRLHFの求人に記載されている時給の中央値。エントリーレベルは、AIトレーニングの経験が不要であることを意味します。
エントリーレベル
$72/hr
282件の時給制求人
中級
$45/hr
51件の時給制求人
エキスパート
$70/hr
39件の時給制求人
優れたRLHF評価者の条件
チームは評価者同士、および模範解答(ゴールドエグザンプル)と比較して評価者を測定します。高評価を得る特徴は以下の通りです:
- キャリブレーション(基準のすり合わせ)。 5段階評価の4が、月曜日と金曜日で同じ意味を持ち、ガイドライン作成者の4と同じ意味を持つこと。
- 文章による理由付け。 すべてのスコアに対する短く具体的な根拠。「条約は1848年に署名されたと主張しているが、正しくは1846年である」は、「不正確」という評価に勝ります。
- 全体を読むこと。 長い回答は、最後にエラーが隠れていることがあります。
- スタイルに惑わされないこと。 自信に満ちた、整った形式の回答が正解とは限りません。
- 不確実性に対する誠実さ。 検証できない部分にフラグを立てることは評価されます。推測は評価されません。
RLHFの仕事を得るには
- 学歴、言語、およびプロレベルで判定できる専門分野を記載したOpenTrainプロフィールを作成します。
- モデル評価およびRLHFの求人を閲覧し、専門分野に合った求人に応募するか、エントリーレベルのAI求人から始めましょう。
- 評価テストが実施されることを想定してください。AIトレーニングの面接に合格する方法では、テスト内容について解説しています。
- 採用後、合格者はOpenTrainのプロジェクトに参加するか、サポートするプロジェクトのクライアント企業に配置または紹介される場合があります。
すべての職種の報酬については、AIトレーニングの報酬レート指標をご覧ください。全体像については、AIトレーナーの仕事内容をお読みください。
よくある質問
人間のフィードバックからの強化学習(Reinforcement learning from human feedback)です。人がモデルの出力を評価・比較し、報酬モデルがその好みを学習します。その後、報酬モデルが高く評価する回答を生成するようにAIモデルが調整されます。
RLHFの仕事は、人間のフィードバックを作成する有給の業務です。具体的には、2つの回答の比較、評価基準に基づく回答の採点、不十分な回答の書き直し、会話例の作成などを行います。これはOpenTrainにおけるAIトレーニング業務の最大のカテゴリーです。
ほとんどの場合、必要ありません。募集中のRLHFの職種の約79%はエントリーレベルであり、注意深い読解力、明確な文章力、そして一貫性が求められます。化学、法律、ソフトウェアなどの分野に関連する職種では、その分野の専門知識が求められます。
OpenTrainで募集中のRLHFの職種は、時給の中央値が$70で、全体の半数が$50から$105の間です。エントリーレベルのRLHFの職種は、時給の中央値が$72です。