暴言や脅しをAIが見分ける「AIフィルター」の仕組みと使い方
2026-09-25
AIフィルターとは
AIフィルターは、kiiteに届いた質問のうち、受け取った人を傷つけたり脅かしたりするものをAIが自動で見分ける機能です。該当した質問は、管理画面の普段の一覧には出さず、「AIフィルター」という別の場所に振り分けます。
匿名で質問を受け付けていると、どうしても心ない言葉が届くことがあります。削除すれば見えなくなるとはいえ、削除するには一度読まなければなりません。AIフィルターは「読む前に分けておく」ことで、見たくない言葉を目にする回数そのものを減らすために作りました。
設定は不要で、すべてのユーザーに自動で適用されます。
振り分けられるもの
AIフィルターが対象にしているのは、次のような質問です。
- 受け取った人への暴言:「死ね」「消えろ」「死んで」など。ひらがなや連投、冗談めかした書き方でも、相手に向けた罵倒であれば対象になります
- 殺害や暴力の予告:「殺す」「包丁を持って行く」「殴りに行く」など
- 個人情報をさらす脅し:「住所を知っている」「本名をさらす」「特定する」など、相手を怖がらせる書き込み
- 自殺や自傷をそそのかす言葉:「自殺しろ」「生きてる価値がない」など
振り分けられないもの
一方で、次のようなものは通常どおり届きます。
- 好意や自虐の言い回し:「尊すぎて死ぬ」「毎回しんでます」「死んでくる(寝る)」のような表現
- 軽い質問:「本名ですか?」「住所どこ?」のように、脅しではなくただ尋ねているだけのもの
- 受け取った人以外への文句:天気や、アンチ全般に向けた愚痴など
- アニメや歌詞の引用、悩み相談
「死ね」という言葉が入っているかどうかだけで判断すると、「尊すぎて死ぬ」のような好意的なメッセージまで届かなくなってしまいます。AIフィルターは言葉だけでなく、文脈から「受け取った人に向けた攻撃かどうか」を見ています。
どうやって判定しているのか
判定は2段階で行っています。
1段目:言葉で候補を絞る
まず、「死ね」「殺す」「住所」など、暴言や脅しに使われやすい言葉が含まれているかを確認します。届く質問のうち、ここで候補になるのは2%ほどです。残りの大多数の質問は、この時点でそのまま届きます。
2段目:候補だけをAIが読む
候補になった質問だけを、AIが文脈を踏まえて読み、「受け取った人への攻撃や脅しか」「冗談や好意の表現か」を判断します。攻撃や脅しと判断されたものが、AIフィルターに振り分けられます。
すべての質問をAIに読ませず、候補だけに絞っているのは、普通の質問が誤って振り分けられるのを防ぐためです。
開発時に、実際に届いた質問のうち暴言や脅しに使われやすい言葉を含む約430件で試したところ、振り分けるべきものの約97%を見分けることができました。
管理画面での使い方
AIフィルターに振り分けられた質問があると、管理画面の「すべて」「未回答」「回答済み」の並びに「AIフィルター」ボタンが表示されます。右上の未回答数には含まれません。
中身を見ずに削除する
「AIフィルター」を開いても、最初は質問の中身は表示されません。「質問を全て削除」を押せば、一度も読まずにまとめて削除できます。
中身を確認する
「質問を表示」を押すと、振り分けられた質問が表示されます。1件ずつ「削除する」で消すこともできます。
回答する
AIの判断が間違っていた場合や、あえて答えたい場合は「回答欄を開く」から回答できます。回答した質問は通常の質問と同じ扱いになり、公開ページにも表示されます。
質問を送る人へ
AIフィルターに振り分けられても、送った側には「送信できませんでした」とは表示されません。言い換えて送り直すことを防ぐためです。受け取った人はその質問を開かずに削除できるので、暴言や脅しを送っても相手に届く可能性は低くなります。
kiiteは匿名のサービスですが、匿名だから何を言ってもいいわけではありません。受け取った人が答えたくなるような質問を送ってください。
AIフィルターの限界
AIも完璧ではありません。
- 見逃すことがあります:遠回しな表現や、伏せ字を多用した書き込みは見逃す場合があります。見逃されたものは、管理画面から個別に削除できます
- 冗談を振り分けることがあります:「楽しいと答えなかったら〇〇する」のような、冗談めかした脅しは振り分けられることがあります。気になる場合は「質問を表示」で確認してください
- AIが使えないときは通常どおり届きます:AIの処理に失敗した場合は、質問を止めずにそのまま届けます
プライバシーについて
判定のために、質問の内容をCloudflare社のWorkers AIで処理しています。判定に使うのは質問の文章だけで、送った人が誰かを特定することはありません。詳しくはプライバシーポリシーをご覧ください。
まとめ
- AIフィルターは、暴言や脅しにあたる質問をAIが自動で見分けて、普段の一覧とは別の場所に振り分ける機能です
- 「尊すぎて死ぬ」のような好意的な表現は、文脈から判断して通常どおり届けます
- 振り分けられた質問は、中身を見ないまままとめて削除できます
- 設定は不要で、すべてのユーザーに自動で適用されます
匿名だからこそ届く本音を、安心して受け取れるように。これからもkiiteは、使う人を守る仕組みを改善していきます。