論文・Webブログいい感じに翻訳、いい感じに管理

クレジットカード不要・Freeプランでずっと使えます

Direct Preference Optimization: Your Language Model is Secretly a Reward Model

4 直接選好最適化(DPO)

これで人間の選好データの確率を、報酬モデルではなく最適方策で表せた。したがって、パラメータ化された方策 πθ\pi_\theta に対する最尤推定の目的関数を定式化できる。報酬モデリング(式 (2))と同様に、方策の目的関数は次のようになる。

LDPO(πθ;πref)=−E(x,yw,yl)∼D[log⁡σ(βlog⁡πθ(yw∣x)πref(yw∣x)−βlog⁡πθ(yl∣x)πref(yl∣x))]\mathcal{L}_{\text{DPO}}(\pi_\theta; \pi_{\text{ref}}) = -\mathbb{E}_{(x, y_w, y_l) \sim \mathcal{D}} \left[ \log \sigma \left( \beta \log \frac{\pi_\theta(y_w \mid x)}{\pi_{\text{ref}}(y_w \mid x)} - \beta \log \frac{\pi_\theta(y_l \mid x)}{\pi_{\text{ref}}(y_l \mid x)} \right) \right]

LDPO(πθ;πref)=−E(x,yw,yl)∼D[log⁡σ(βlog⁡πθ(yw∣x)πref(yw∣x)−βlog⁡πθ(yl∣x)πref(yl∣x))]\begin{aligned} &\mathcal{L}_{\text{DPO}}(\pi_\theta; \pi_{\text{ref}}) = -\mathbb{E}_{(x, y_w, y_l) \sim \mathcal{D}} \Bigl[ \log \sigma \Bigl( \\ &\quad \beta \log \frac{\pi_\theta(y_w \mid x)}{\pi_{\text{ref}}(y_w \mid x)} - \beta \log \frac{\pi_\theta(y_l \mid x)}{\pi_{\text{ref}}(y_l \mid x)} \Bigr) \Bigr] \end{aligned}

このように、別のパラメータ化によって暗黙的な報酬を当てはめる。その最適方策は単に πθ\pi_\theta である。さらにこの手順は再パラメータ化した Bradley-Terry モデルの当てはめと等価なので、選好データの分布に関する適切な仮定のもとでの一致性など、一定の理論的性質をもつ [4]。

原文・訳文・PDF を切り替えても、読んでいる位置はそのまま。

例示: Rafailov et al., NeurIPS 2023 (arXiv:2305.18290), CC BY 4.0。訳文は表示例です。

翻訳の質

数式も、図も、引用も。
壊さずに訳す。

PDF の文字だけを抜き出して訳すと、数式はばらばらになり、log は「ログ」に訳され、文は途中で途切れます。Re:Babel は AI が紙面ごと読み取り、数式を数式のまま、章の文脈を保って翻訳します。

文字だけを抜き出した翻訳(例)

L DPO(π θ;π ref)= − E(x、y w、y l)∼ D ログ σ β ログ π θ(y w | x)π ref(y w | x)− β ログ π θ(y l | x)π ref(y l | x)(7)

分数と添字がばらばらlog が「ログ」に
Re:Babel

LDPO(πθ;πref)=−E(x,yw,yl)∼D[log⁡σ(βlog⁡πθ(yw∣x)πref(yw∣x)−βlog⁡πθ(yl∣x)πref(yl∣x))]\mathcal{L}_{\text{DPO}}(\pi_\theta; \pi_{\text{ref}}) = -\mathbb{E}_{(x, y_w, y_l) \sim \mathcal{D}} \left[ \log \sigma \left( \beta \log \frac{\pi_\theta(y_w \mid x)}{\pi_{\text{ref}}(y_w \mid x)} - \beta \log \frac{\pi_\theta(y_l \mid x)}{\pi_{\text{ref}}(y_l \mid x)} \right) \right]

LDPO(πθ;πref)=−E(x,yw,yl)∼D[log⁡σ(βlog⁡πθ(yw∣x)πref(yw∣x)−βlog⁡πθ(yl∣x)πref(yl∣x))]\begin{aligned} &\mathcal{L}_{\text{DPO}}(\pi_\theta; \pi_{\text{ref}}) = -\mathbb{E}_{(x, y_w, y_l) \sim \mathcal{D}} \Bigl[ \log \sigma \Bigl( \\ &\quad \beta \log \frac{\pi_\theta(y_w \mid x)}{\pi_{\text{ref}}(y_w \mid x)} - \beta \log \frac{\pi_\theta(y_l \mid x)}{\pi_{\text{ref}}(y_l \mid x)} \Bigr) \Bigr] \end{aligned}

数式は数式のまま用語は分野の訳語で

ライブラリ

読むために溜める、
読むために訳す。

気になった論文は、とりあえずライブラリへ。翻訳は読むと決めたときに。タイトル・著者・掲載誌は自動で補われます。

01

積む

PDF をドロップ、Web ページの URL を貼る、Markdown を取り込む。DOI や arXiv ID からメタデータを自動で補います。

02

整理する

タグ、コレクション、掲載誌で絞り込み。読書状態も記録され、読みかけの論文は続きから開けます。

03

引用する

BibTeX・RIS をワンクリックでコピー。コレクションごとに .bib で書き出せます。

読書体験

読む時間を、読むことに。

引用は、その場で確かめる

本文の [4] から、著者・掲載誌・PDF・DOI・BibTeX までページを離れずに。

ハイライトとメモ

原文にも訳文にも、4色のハイライトとメモ。書き出した Markdown にも残ります。

用語集で訳語をそろえる

分野の訳語を登録すると、次の翻訳から一貫して使われます。CSV でまとめて取り込みも。

品質を上げて、訳し直せる

再翻訳は新しい版として追加。前の訳もいつでも読み返せます。

プラン

まずは無料で。物足りなくなったら、いつでもアップグレードできます。

Free
¥0 / 月
  • 文献追加 20 件 / 月
  • PDF 180 ページクレジット / 月(OCR + 標準グレード翻訳で約 45 ページ)
  • Webページ 300 クレジット / 月
  • Markdown 300 ページクレジット / 月
  • 基本グレード・標準グレードの品質
  • 訳文の閲覧は作成から30日間
無料で始める
Plusおすすめ
¥500 / 月
  • 文献追加 200 件 / 月
  • PDF 1,500 ページクレジット / 月(OCR + 標準グレード翻訳で約 375 ページ)
  • Webページ 1,500 クレジット / 月
  • Markdown 1,500 ページクレジット / 月
  • ダウンロード・エクスポート(訳文・原文・対訳 Markdown、原本ファイル、BibTeX/RIS、印刷)
  • 訳文を期限なく閲覧
Plus を始める
Pro
¥3,000 / 月
  • 文献追加 2,000 件 / 月
  • PDF 9,000 ページクレジット / 月(OCR + 標準グレード翻訳で約 2,250 ページ)
  • Webページ 9,000 クレジット / 月
  • Markdown 9,000 ページクレジット / 月
  • 高精度グレードの品質
  • ダウンロード・エクスポート(訳文・原文・対訳 Markdown、原本ファイル、BibTeX/RIS、印刷)
  • 訳文を期限なく閲覧
Pro を始める

価格は税込。クレジットは OCR と翻訳で、ページ数に応じて消費されます。

よくある質問

無料で使えますか?

はい。Freeプランはクレジットカード不要でずっと無料です。毎月のページクレジットの範囲でOCRと翻訳を試せます。

どんなドキュメントに対応していますか?

PDF のアップロード、Web ページの URL、Markdown ファイルやテキストの取り込みに対応しています。論文・技術ドキュメント・ブログ記事などに向いています。

翻訳の品質はどのくらいですか?

最新のLLMを使い、章単位の文脈・用語集・翻訳メモリを反映して翻訳します。用途に合わせて基本グレード・標準グレード(Proでは高精度グレード)の品質を選べます。

プランの変更や解約はできますか?

いつでもできます。支払いはStripeで安全に処理され、アプリ内のプラン画面から変更・解約できます。

積んでいる論文、
今日から読めます。

Google・GitHub・メールで、すぐに始められます。

無料で始める