Netwrix 1Secureは、データとアイデンティティ全体にわたる統合された可視性を提供します。14日間の無料トライアルでフルアクセス可能です。無料トライアルを開始

リソースセンターブログ

eDiscovery 用語解説

eDiscovery 用語解説

Aug 26, 2025

eDiscoveryは、法律・技術・ 情報ガバナンス の概念にまたがる共通の語彙に依存しています。主要な用語には、証拠能力(admissibility)、証拠保管の連鎖(chain of custody)、メタデータ(metadata)、保管担当者(custodian)、訴訟保全(litigation hold)が含まれます。さらに、選別(culling)、重複排除(deduplication)、マスキング/削除(redaction)などのプロセスも扱います。法律と IT の両方の文脈における定義を理解することで、組織は電子データを防御可能で(defensible)正確に取り扱いながら、証拠を保全し、調査(discovery)を効率化し、コンプライアンス上の義務を満たすことができます。

電子的ディスカバリー(eDiscovery または e-discovery) は、さまざまな法的手続きおよび規制上の要件へのコンプライアンスにとって重要です。効果的に連携するためには、IT担当者と法務チームが、法律上の用語だけでなく関連する技術用語も含めた e-discovery の用語について共通の理解を持つ必要があります。

主要な eDiscovery 用語の定義は以下のとおりです:

  • 許容(Admissible):法廷で使用できる、関連性があり信頼できる証拠。
  • アナリティクス(Analytics): 生データを分析し、その情報について結論を導くために用いられるさまざまな技術を指します。
  • アーカイブ(Archive): 記録やファイルを長期間保存するためのリポジトリ。
  • 支援レビュー: キーワードやその他のメタデータに基づいて、潜在的に関連性のある文書を特定し、タグ付けするためにコンピューター技術を使用すること。
  • 添付ファイル:電子メールのメッセージに添付して送られる電子ファイル。
  • 添付ファイルのバックアップ: 元のデータの紛失または損傷に備えるために、コンピューターシステムとは別に保管する目的でデータのコピーを作成する行為、およびその結果。
  • バックアップテープ:元のデータの紛失または損傷に備えるために作成されたデータのコピーを保存するために用いるテープ媒体。
  • バッチ処理: 個別の処理を順番に実行するのではなく、1つの手順で大量の ESI(電子的に保存された情報)を収集すること。
  • ビッグデータ: ボリューム(量)、速度、多様性のいずれも高い、構造化および非構造化のデータセットの集合です。ビッグデータは、ESIの非常に大規模なコレクションを指す場合もあります。
  • ブール検索:コンピュータの先駆者ジョージ・ブール(George Boole)が考案した論理体系です。ブール検索では、AND、OR、NOT などの演算子をキーワードと組み合わせて、返ってくる結果を絞り込みます。たとえば、2つの単語の間にAND演算子を使うと、両方の単語を含む文書のみが返されます。一方、2つの単語の間にOR演算子を使うと、対象の単語のいずれかを含む文書が返されます。
  • 証拠保全(Chain of custody): 収集から提出(作成/作成物の提示)までの間、電子的証拠の移動、取り扱い、所在地を時系列で追跡することです。証拠保全(Chain of custody)は、提示される証拠が改ざんされていないこと、そして真正なものであることを示すのに役立ちます。
  • 子文書(Child document): 例えばメールの添付ファイル、ワープロ文書に埋め込まれたスプレッドシート、あるいはzipファイル内の各圧縮文書のように、別のファイルに添付されているファイルです。なお 親文書。
  • コーディング(Coding):各文書ごとに、事件に関連する情報をフォームに記入すること(作成者、作成日、送信日、受信者、開封日など)。適切なコーディングにより、すべての文書を一貫した識別子で結び付けられるため、混乱を避け、調査の生産性を高めることができます。
  • コンピューターフォレンジクス: データを取得し、削除された、暗号化された、または破損したファイル情報を復元するためのコンピューター調査および分析手法。
  • コンセプト検索 (サイソーラス、同義語、または関連検索):提示された検索語だけでなく、それに関連する語も用いて結果を返す検索手法です。コンセプト検索は、シンプルなサイソーラスの照合、または高度な統計分析手法によって実装できます。
  • コンテナーファイル: 複数の他のファイルまたはオブジェクトを含むアプリケーションまたはオブジェクトで、アーカイブや、埋め込みまたはリンクされたオブジェクトを含む複合ドキュメントのように、ファイルとして表現され得ます。一般的なコンテナーファイル形式には、zip、rar、pst があります。
  • キューリング: 定義された基準(日時、キーワード、保管担当者など)を用いて、データの集合を最も関連性の高い電子文書に絞り込むこと。
  • Custodian(データ保管担当者):組織の security policy または標準の IT 実務に従ってデータを保護しながら、データセットの集約、保存、利用を担う人。
  • データ抽出: 電子文書からデータを解析してメタデータおよび本文コンテンツを特定するプロセス、または、潜在的に関連する ESI とメタデータを元のソースから別のリポジトリへ取得するプロセスです。
  • データマッピング:組織のネットワーク内における ESI の所在場所と種類を特定し、記録するプロセスです。データマッピングは、他の手法では明らかにならない可能性のあるファイル間の関連性を見つけたり示唆したりします。
  • 重複排除(de-duplication または de-duping):ドキュメントの集合の中で、重複した文書のコピーを特定して削除するプロセスです。重複排除には 3 種類があります:case、custodian、production。
  • DeNisting(deNISTing または de-nisting):結果セットからオペレーティング システムのファイルおよびその他の非ユーザー作成データを削除するプロセスです。NIST(National Institute of Standards and Technology)は、通常は案件に関係しないことが多い一方で、収集した ESI セットのかなりの部分を占めることがある、4,000 万件以上の既知ファイルのリストを提供しています。
  • ディスカバリー(Discovery): 法的手続きにおいて、潜在的な証拠となり得る情報を特定し、取得し、確認(レビュー)するプロセスです。米国では、さらに、裁判前に相手方当事者へ文書を提供する手続きも意味します。
  • 文書ファミリー: 電子メールとその添付ファイルのように、関連する文書のグループです。
  • Early case assessment (ECA):特定の法的手段を追求する際のリスクとコストを見積もるために、法的案件の早い段階で潜在的な証拠を特定し、収集するプロセスです。
  • 電子的ディスカバリ(Electronic discovery)(ED、digital discovery、electronic digital discovery、electronic document discovery、EDD または electronic evidence discovery):訴訟のために関連する ESI を見つけ、特定し、所在を突き止め、確認(レビュー)し、提出するプロセスです。
  • 電子的証拠(Electronic evidence):電子形式で保存され、法的案件において主張を立証または反証するために用いられる情報です。
  • Electronically stored information (ESI):ハードドライブ、オンラインのソーシャルネットワーク、PDA、スマートフォン、ボイスメール、テキストメッセージングアプリケーション、その他の電子データ保管場所に見つかるデータです。米国連邦民事訴訟規則(FRCP)のもとでは、ESI はコンピュータのハードウェアとソフトウェアの使用を必要とし、デジタル形式で作成・操作・通信・保管され、デジタル形式で最も適切に利用される情報を指します。
  • Email: Microsoft Outlook や Google Gmail のようなアプリケーションを使用して送受信される電子メッセージ。
  • Filtering: 指定されたパラメーター(データ範囲やデータ型など)に合わない文書を除外することで、データセットを縮小すること。
  • Forensics: Computer forensics を参照してください。
  • FRCP(Federal Rules of Civil Procedure:米国連邦民事訴訟規則):米国の連邦地方裁判所で審理される大部分の民事事件に適用される規則で、電子ディスカバリーおよび ESI(電子的に保存された情報)の取り扱いに関する規定が含まれます。
  • Harvesting: 調査や訴訟で使用するために電子データを収集すること。可能であれば、ファイルおよびシステムのメタデータを維持しながら行います。
  • ハッシュ: 電子文書を検証するための値を作成するアルゴリズム。ハッシュマークはデジタル指紋として機能します。
  • ホスティング: eDiscovery において、第三者の訴訟支援会社が提供するサービスであり、レビュー用ソフトウェアのプラットフォーム上で、特定の案件(事項)に関連する文書へアクセスできるようにします。
  • イメージ(ドライブ) (ミラーイメージまたはミラーリング):空き領域を含む、ハードディスクの完全に同一なコピー。
  • イメージ(ファイル): 文書の画像としてのコピー。eDiscovery で最も一般的な形式は TIFF と PDF です。
  • キーワード検索:指定した文字列を含む文書を探すプロセスです。標準的なキーワード検索では指定した完全一致の文字列のみが一致しますが、ほとんどの訴訟支援用検索エンジンでは stemming(語幹化)を用いて、追加の結果を返します。
  • レガシーデータ: 時代遅れまたは時代遅れになった(旧式の)ソフトウェアやハードウェアに保存されている情報、または形式が時代遅れになったデータ。
  • リティゲーション・ホールド(法的ホールド、ホールド命令、保存命令、中止命令、フリーズ通知、ホールド通知、破棄停止通知):証拠の隠滅や破棄(spoliation of evidence)を防ぐために、法務担当(弁護士側)が組織に対して、記録の通常の処理(例:バックアップテープのリサイクル)を停止するよう求める通知または連絡。
  • ロードファイル:文書の画像(例:スキャン画像)を電子データ開示(electronic discovery)プラットフォームに取り込むために使用するファイルで、文書を検索可能な状態に保つために必要な対応するテキストおよびメタデータのファイルも含みます。現在は、多くの文書レビュー・プラットフォームがドキュメントをそのネイティブ形式で取り込めるため、ロードファイルが不要となることがよくあります。
  • メディア: 電子情報が保存されているデバイス。例:ハードドライブやバックアップテープ。
  • メタデータ:電子ファイルに埋め込まれたデータで、そのファイルに関する情報(どのように、いつ、誰によって作成・編集・処理されたか、または含まれているデータの種類など)を提供します。
  • ミラーイメージ:参照 Image (drive)。
  • ネイティブ形式: 電子ファイルが最初に作成されたときの形式です。ネイティブのファイル形式では、メタデータや、ロードファイルを使用する場合などに文書を別の形式へ変換すると失われてしまう可能性があるその他の詳細情報が保持されます。
  • ニア・デュプリケート:別の文書と非常に似ている文書です。ニア・デュプリケートは、レビューに関連する時間とコストを削減するために、データ削減(data reduction)プロセス中に特定されます。
  • 正規化: データを標準形式に再フォーマットするプロセスです。
  • 光学文字認識(OCR): スキャンした文書を検索可能なテキストに変換するプロセスです。
  • 親ドキュメント: 一つのセット内の他のドキュメントやファイルが関連付けられる主要ドキュメント。子ドキュメントも参照してください。
  • 適合率: クエリが文書を「レスポンシブ(関連あり)」として正確に予測できる頻度の指標です。適合率が低い場合は、無関係な文書が多く出力されたことを示します。適合率が高い場合は、出力された文書の大半がレスポンシブであったことを示しますが、すべての関連文書が提供されたことは保証されません。再現率も参照してください。
  • 予測コーディング: レスポンシブでない文書の数を減らすためのプロセスです。多くの場合、機械学習、キーワード検索、フィルタリング、サンプリングの組み合わせを使用します。
  • 特権: 特別な法的な利益または権利のことです。たとえば、個人とその弁護士との間の特定の通信は、開示から保護されます。
  • 処理: データの取り込み(ingestion)およびその後の取り扱いを指します。多くの場合、pst や zip アーカイブからのファイル抽出、添付ファイルの分離、レビュー ツールが読める形式へのファイル変換、テキストとメタデータの抽出、データの正規化などを含みます。
  • Production: 調査(discovery)依頼の基準を満たす ESI を、適切な形式で、適切な提供メカニズムを用いて、相手方の弁護士または依頼者に届けること。
  • PST: Outlook や Windows Messaging などの Microsoft 製品で、メッセージ、カレンダーイベント、その他のアイテムを保存するために使用されるファイル形式です。これらのファイル自体を指して「PSTs(ピーエスティーズ)」という意味でも一般的に使われます。
  • Recall: クエリが応答文書(responsive documents)をどれだけうまく特定できるかを示す指標です。Recall スコアが 100% の場合、クエリがコレクション内のすべての応答文書を返したことを意味します。Recall スコアが低い場合、応答文書が非応答として不適切に除外されたことを示します。あわせて Precision も参照してください。
  • Records management: 証拠を提供する文書、歴史的価値がある文書、その他のビジネス上の利益をもたらす文書など、組織にとって継続的な維持管理の価値がある重要なデジタルまたは紙の文書を、体系的に監督し管理すること。
  • Redaction: 文書内の特権情報(privileged)、専有情報(proprietary)、または機密情報(confidential)を、その情報の上に黒い領域を重ねることで取り除く手順です。
  • 応答性: その文書が依頼(リクエスト)に関連しているかどうかを測る指標です。
  • 検索: 特定の基準(クエリ)を使ってデータセット内の用語を見つけ出すプロセスです。検索は単純なキーワードで実行することも、クエリ語が文書内に存在しない場合でも、そのクエリに関連する文書を特定できる概念検索によって行うこともできます。
  • スラック領域: データが割り当てられた領域を完全に埋めない場合に生じる未使用の領域です。スラック領域には、現在のレコードと同じ物理的な位置に保存されていた過去のレコードの情報、メタデータ断片、またはコンピュータシステムのフォレンジック分析に役立つその他の情報が含まれることがあります。
  • ソーシャル・ディスカバリー: Facebook、Twitter、YouTube、LinkedIn、Instagram などのソーシャルメディア上で ESI を発見することです。
  • スペリアーション(Spoliation): 進行中または見込まれる訴訟、政府の調査、あるいは監査に関連する可能性のあるデータを、改変したり削除したり、部分的に破壊したりすることです。証拠になり得る情報を保存しなかった場合もスペリアーションに当たります。
  • 語幹抽出(Stemming): 指定された文字列に対する一致結果だけでなく、その文字列の文法的なバリエーションも返すキーワード検索手法です。たとえば、語幹抽出を使ってキーワード「related」を検索すると、「relating」「relates」、または「relate」を含む文書も返されます。
  • 構造化データ(Structured data):リレーショナルデータベースに存在するデータで、データ同士の関係性を認識できるように構造化されています。あわせて 非構造化データ(Unstructured data)。
  • システムファイル(System files): コンピューターによって作成され、オペレーティングシステムまたはその他の制御プログラムの一部となる電子ファイルです。Windows コンピューターで最も一般的なシステムファイルには、msdos.sys、io.sys、ntdetect.com、ntldr などがあります。
  • タグ付け(Tagging):文書に分類タグを割り当てるプロセスです。
  • スレッド(Thread:メール文字列またはチェーン):発信したメールと、それに対するすべての返信および転送。
  • TIFF (Tagged Image Format): よく使われる画像ファイル形式です。この形式に関連するファイル拡張子は .tif です。スキャンした文書は、TIFF 画像として保存されることがよくあります。
  • 未割り当て領域: 新しいデータを保存できるハードドライブ上の領域です。特定のファイルが削除対象としてマークされると、その領域は未割り当て領域としてマークされますが、データが上書きされるまで、なお取得(復元)することができます。
  • Unicode: 世界中のあらゆる言語の文字集合を、統一されたデジタル表現として提供する標準です。Unicode は、どの言語のテキストでも保存し、検索するための統一された手段を提供します。
  • Unitization: 画像を論理的な境界に基づいて解析し、複数の子ドキュメントに分解するプロセスです。
  • 非構造化データ: 構成要素間の意味のある関係を識別できるように、整理されてラベル付けされていない情報です。例として、テキストファイル、サーバーおよびアプリケーションログ、画像、音声・動画ファイル、メールなどが挙げられます。あわせて 構造化データ。

共有する

もっと詳しく

著者について

Dirk Schrader

セキュリティ リサーチの VP

Dirk Schrader は Netwrix の Resident CISO (EMEA) であり、セキュリティ リサーチの VP です。CISSP (ISC²) および CISM (ISACA) の資格を持つ、IT セキュリティ分野で 25 年のベテランとして、サイバー脅威に取り組むための現代的なアプローチであるサイバー レジリエンスの推進に取り組んでいます。Dirk はキャリアの初期に技術およびサポートの役割からスタートし、その後、大規模な多国籍企業から小さなスタートアップまでで、営業、マーケティング、プロダクト マネジメントのポジションへと移行しながら、世界中のサイバーセキュリティ プロジェクトに携わってきました。彼はサイバー レジリエンスを実現するために、変更管理と脆弱性管理に取り組む必要性について、多数の記事を発表しています。