AIが書いた文章の数字を、出典と突き合わせて自動で止められないか。Aid-Onで試したところ、うまくいきませんでした。手法の限界が数字で出たので、その数字ごと公開しています。
作ったもの
emetは、主張と出典URLの組を読み、引用先の実際の本文と照合して終了コードだけで答える仕組みです。すべて裏が取れれば0、ひとつでも止めれば1、入力がおかしければ2を返します。
照合するのは三種類です。数字の連なり、鉤括弧や引用符で囲まれた範囲、大文字で始まる固有名。判定は五つあり、通るのは「裏が取れた」場合だけです。出典が無い、応答しない、数字が無い、この仕組みでは検査できない、はすべて止めます。
「検査できない」を通さないのは意図した選択です。既定が「たぶん大丈夫」になっている関門は、関門として働きません。
測り方
半導体と世界情勢の年表から115件の主張を取り、出典は一度だけ取得して、同じ内容のページで全条件を回しました。102件が応答し、うち101件に本文がありました。
各主張には一種類だけ破壊を加えます。数値を1.7倍にする、名前を差し替える、架空の引用を挿入する。当初は末尾の桁を変える予定でしたが、53.3を53.7にする程度では差が0.75%で、1%の丸め許容に収まってしまい検出できませんでした。
結果
四通りの採点方法と閾値を総当たりしましたが、使える動作点はどこにもありませんでした。最も良い条件でも、正しい主張を61.5%止めてしまう一方、仕込んだ誤りを捕まえられたのは54.9%です。改良を全部足しても利得は6ポイントほどで、実装の粗さではなく手法の天井だと判断しました。
なぜ天井なのか
出典にそのままの形で数字が載っていることが、そもそも少ないためです。本文のある主張のうち、すべての数値がそのまま見つかったのは34%でした。決算資料は「NT$514,806,000 thousand」と書き、記事は「5148.1億台湾ドル」と書きます。十のべき乗をまたいで1%以内で比べる処理を入れて、3ポイント分の改善でした。
証拠が多い主張ほど不利になる、という問題もあります。照合対象が1個のときの誤検出は70.0%、7個以上では85.7%まで上がります。丁寧に書かれた主張ほど止まりやすくなります。
そして決定的だったのは、仕込んだ誤りも正直な言い換えも、照合対象をひとつ変えるという点で同じだったことです。区別する手がかりが残りません。
残ったもの
無駄ではありませんでした。検査できる数字を持たない主張は115件中36件から11件へ減り、最初に通っていた28件のうち10件は年号が一致しただけの偽陽性だと判明しました。リダイレクトとタイムアウトの取りこぼしが、正しい主張を落としていたことも測って初めて見えています。
AIの出力を検証したい方へ
生成物の裏取りを自動化する計画がある場合、この結果は判断材料になります。数値の照合は、出典の表記が揃っていない限り期待したようには働きません。実用的なのは、機械に「怪しいものを全部止めさせる」のではなく、「人が見るべき箇所を絞らせる」設計です。
止められる領域と止められない領域は、測れば分かります。導入前に自社のデータで同じ測り方をしてみることをお勧めします。