OpenAIは、欧州連合(EU)域内でChatGPTとCodexが生成したテキストに、不可視のウォーターマークを導入する。米TechCrunchが10月5日(現地時間)に報じた。8月2日に施行されたEU AI法の透明性規定に対応する措置となる。
ウォーターマークは今後数週間で、EU域内のChatGPTとCodexの全料金プランに順次適用する。OpenAIのAPIを利用する開発者は地域を問わず、5日から一部モデルでこの機能を任意に有効化できる。ただ、初期設定はオフとし、グローバルでデフォルト設定にはしない方針だ。
今回の仕組みは、目に見えるラベルを付ける方式ではない。モデルの単語選択を微調整し、人間には分からない一方で、検知器が識別できるパターンをテキスト内に残す。パターンはテキスト自体に埋め込まれるため、コピー&ペースト後も維持されるという。
OpenAIは、この方式では利用者の身元は特定されず、機能を有効にしてもモデル性能に有意な変化は確認されなかったと説明している。
同社はあわせて、「TextGrain」に関する技術報告書も公開した。報告書は、ペンシルベニア大学とイェール大学の研究者が共同で執筆したもので、秘密鍵を用いて次に出力する単語候補の順位を並べ替える手法を紹介している。こうした微調整を数百回重ねることで、検知器がテキストと鍵だけを手掛かりにAI生成テキストを判別できるようになるというのが同社の説明だ。
もっとも、編集が加わると検知性能は低下する可能性がある。試験では、単語の10%を同義語に置き換えた場合、検知率は約92%から66%に下がった。短文や数式を含む回答、翻訳文も検知が難しいとしている。このため検知器へのアクセス権は当面、認定を受けた研究者や専門機関に限定して提供する。
OpenAIは、ウォーターマークが付いていないからといって、人間が書いた文章だと証明できるわけではないとも指摘する。文章が短すぎる場合や、大幅に編集されている場合があるほか、他社AIが生成したテキストの可能性もあるためだ。また、ウォーターマークで分かるのは、OpenAIのシステムが文章の一部を生成または処理したかどうかまでで、人間の判断や編集、創造性がどの程度反映されたかは示せないとしている。
今回の発表は、Anthropicが2カ月前、Claudeが生成したテキストに対するウォーターマークを世界的に適用する方針を明らかにしたのに続く動きとなる。