Lemma Critical Brief · Category archive
AI 学習データ来歴
AI training data の収集元・利用 scope 属性が独立検証されないまま下流に流通する構造を扱う。chat プラットフォームの公開 API 経由 scraping、規約違反 scope での dataset 配布、AI training audit 層の不在等。
8 件の Brief
Hugging Face の学習データ 7.6PB に、生きた認証情報が 22 万件超あった
検出も通知も届いていたのに、鍵は失効されなかった(Truffle Security 調査)
Figma:AI 学習は個人・小規模チームで既定オン、エンタープライズでは既定オフだった
デザインツール Figma は 2024-08-15 に「コンテンツによる AI 学習(content training)」を発効させた。同社自身の公開ドキュメントによれば、この設定は Starter プランと Professional プランでは既定でオン、Organizati…
芸能人・声優の肖像と声の無断利用が主要 SNS で 4 万件超、削除率 100% を達成したモデルも同じ人物で再投稿された(JAPRO 2025年度調査)
特定非営利活動法人 肖像パブリシティ権擁護監視機構(JAPRO)が 2026-06-25、2025 年度の実態調査を公表した。主要 SNS における肖像権・パブリシティ権の侵害疑義投稿は延べ 4 万件超・閲覧約 3.35 億回。最も重い所見は削除の実証結果で、某俳優の肖像を使用し…
Common Crawl:LLM の学習に使われる公開コーパスに、約1.2万件の「生きた」認証情報が混入していた
学習データの来歴が取り込みの前に検証されない構造(Truffle Security)
Bright Data SDK:家庭のテレビが、AI 学習向けスクレイピングの中継ノードにされていた
収集データと中継トラフィックの出所・同意が、独立検証されない構造(Include Security)
著作権キャラが、権利者が拒否するまで生成され続けた
キャラ生成の時点で、用いる素材の来歴・許諾が固定されない構造(OpenAI Sora 2 / CODA・日本政府)
128 億枚の AI 学習データに、パスポート・履歴書・顔が混入していた
学習データの来歴と同意が、収集の時点で検証されていなかった
公開 API 経由の Discord 20.5 億メッセージのスクレイピング
公開チャンネルデータが AI 学習データセットとして再配布される構造