eDiscovery는 법률, 기술 및 정보 거버넌스 개념을 아우르는 공통 어휘에 의존합니다. 주요 용어에는 증거의 채택가능성(admissibility), 증거 보관 사슬(chain of custody), 메타데이터(metadata), 증거 보관자(custodian), 소송 보류(litigation hold)가 포함되며, 선별(culling), 중복 제거(deduplication), 편집/가림(redaction) 같은 프로세스도 함께 다룹니다. 법률과 IT 맥락 모두에서 정의를 이해하면, 전자 데이터에 대한 방어 가능한(defensible) 정확한 처리를 보장하는 동시에 조직이 증거를 보존하고 조사를 간소화하며 규정 준수 의무를 충족하는 데 도움이 됩니다.
전자적 증거개시(eDiscovery 또는 e-discovery) 는 다양한 법적 절차와 규제 의무 준수에 있어 매우 중요합니다. 효과적으로 협업하려면 IT 담당자와 법무 팀은 법률 명칭뿐 아니라 관련 기술 용어까지 포함한 e-discovery 용어에 대해 공통된 이해가 필요합니다.
엄선한 관련 콘텐츠:
다음은 주요 eDiscovery 용어의 정의입니다:
- 허용 가능: 법정에서 사용할 수 있는 관련성 있고 신뢰할 수 있는 증거.
- 분석(Analytics): 원시 데이터를 분석하여 해당 정보에 대한 결론을 도출하는 데 사용되는 다양한 기술을 의미합니다.
- 아카이브(Archive): 기록과 파일을 장기적으로 보관하기 위한 저장소.
- 지원 검토: 키워드 및 기타 메타데이터를 바탕으로 잠재적으로 관련성이 있는 문서를 식별하고 태그(라벨)하기 위해 컴퓨터 기술을 사용하는 것.
- 첨부파일: 이메일 메시지와 함께 전송되는 전자 파일.
- 첨부파일 백업: 원본 데이터의 손실 또는 손상을 방지하기 위해, 컴퓨터 시스템과 별도로 보관할 데이터의 복사본을 생성하는 행위와 그 결과를 모두 의미합니다.
- 백업 테이프: 원본 데이터의 손실 또는 손상을 방지하기 위해 생성한 데이터 복사본을 저장하는 데 사용하는 테이프 매체.
- 일괄 처리: 순차적으로 개별 프로세스를 사용하는 대신, 많은 양의 ESI(전자적으로 저장된 정보)를 한 단계에서 수집하는 과정.
- 빅 데이터: 볼륨(양), 속도(처리 속도) 및 다양성의 측면에서 규모가 큰, 구조화 및 비구조화 데이터셋의 모음입니다. 빅 데이터는 ESI의 매우 큰 컬렉션을 의미하기도 합니다.
- 불(Boolean) 검색: 컴퓨터 개척자 조지 불(George Boole)이 개발한 논리 체계입니다. 불 검색은 AND, OR, NOT 같은 연산자를 키워드와 결합해 반환되는 결과를 좁힙니다. 예를 들어, 두 단어 사이의 AND 연산자는 두 단어를 모두 포함하는 문서만 반환하고, 두 단어 사이의 OR 연산자는 대상 단어 중 어느 하나를 포함하는 문서를 반환합니다.
- 증거의 인계(Chain of custody): 수집부터 제출(제작/제시)까지 전 과정에서 전자 증거의 이동, 취급, 위치를 시간순으로 추적하는 것을 말합니다. 증거의 인계는 제공되는 증거가 조작되지 않았고 진본임을 보여주는 데 도움이 됩니다.
- 자식 문서(Child document): 이메일 첨부파일, 워드 처리 문서에 포함된 스프레드시트, 또는 zip 파일 안의 각 압축 문서처럼 다른 파일에 첨부된 파일을 말합니다. 또한 부모 문서.
- 코딩(Coding): 각 문서에 대해 사건과 관련된 정보를 기입하는 것으로, 작성자, 작성일, 발송일, 수신자, 열람일 등(기타) 사항을 포함합니다. 적절한 코딩을 하면 일관된 식별자를 사용해 모든 문서를 서로 연결할 수 있어 혼란을 줄이고 연구를 더 생산적으로 만들 수 있습니다.
- 컴퓨터 포렌식: 데이터를 수집하고 삭제되었거나 암호화되었거나 손상된 파일 정보를 복구하기 위한 컴퓨터 조사 및 분석 기법.
- 개념 검색 (테서러스, 동의어 또는 관련 검색): 제공된 질의 단어뿐 아니라 그와 관련된 단어도 함께 사용해 결과를 반환하는 검색 기법입니다. 개념 검색은 간단한 테서러스 매칭이나 정교한 통계 분석 방법으로 구현할 수 있습니다.
- 컨테이너 파일: 여러 개의 다른 파일 또는 객체를 포함하는 애플리케이션이나 개체로, 아카이브나 포함(임베디드) 또는 연결(링크)된 객체가 포함된 복합 문서처럼 파일로 표현될 수 있습니다. 일반적인 컨테이너 파일 형식으로는 zip, rar, pst가 있습니다.
- 컬링: 정의된 기준(날짜, 키워드, 담당자 등)을 사용해 데이터 집합을 가장 관련성 높은 전자 문서로 줄이는 것.
- 보관 담당자(데이터 보관 담당자): 조직의 security policy 또는 표준 IT 관행에 따라 데이터를 보호하면서 데이터 세트의 수집, 저장 및 사용을 담당하는 사람.
- 데이터 추출: 전자 문서에서 메타데이터와 본문 콘텐츠를 식별하기 위해 데이터를 구문 분석(파싱)하는 과정이거나, 잠재적으로 관련된 ESI 및 메타데이터를 원래 소스에서 다른 저장소로 가져오는 과정입니다.
- 데이터 매핑: 조직의 네트워크 내에서 ESI의 위치와 유형을 식별하고 기록하는 과정입니다. 데이터 매핑은 다른 기법으로는 명확하지 않을 수 있는 파일 간의 연관성을 찾아내거나 제안합니다.
- 중복 제거 (de-duplication 또는 de-duping): 문서 컬렉션 내의 문서 사본을 식별하고 제거하는 과정입니다. 중복 제거에는 세 가지 유형이 있습니다: 케이스(case), 보관자(custodian), 프로덕션(production).
- DeNisting (deNISTing 또는 de-nisting): 결과 집합에서 운영 체제 파일과 기타 비사용자 생성 데이터를 제거하는 과정입니다. NIST(National Institute of Standards and Technology)는 일반적으로 사건과 무관하지만 수집된 ESI 세트에서 상당한 비중을 차지하는 경우가 많은 4,000만 개가 넘는 알려진 파일 목록을 제공합니다.
- 디스커버리(Discovery): 법적 사안에서 잠재적 증거가 될 수 있는 정보를 식별하고, 확보하며, 검토하는 과정입니다. 미국에서는 또한 소송 이전에 상대방에게 문서를 제공하는 절차를 의미하기도 합니다.
- 문서 패밀리: 이메일과 첨부 파일처럼 서로 관련된 문서들의 그룹입니다.
- 초기 사건 평가(ECA): 특정한 법적 조치 방안을 추진할 때의 위험과 비용을 추정하기 위해, 법적 사안 초기에 잠재적 증거를 식별하고 수집하는 절차입니다.
- 전자적 증거개시(Electronic discovery)(ED, digital discovery, electronic digital discovery, electronic document discovery, EDD 또는 electronic evidence discovery): 소송 목적을 위해 관련 ESI를 찾고, 식별하고, 위치를 파악하고, 검토한 뒤 제출하는 절차입니다.
- 전자적 증거(Electronic evidence): 전자 형식으로 저장되어 법적 사안에서 주장을 입증하거나 반박하는 데 사용되는 정보입니다.
- 전자 저장 정보(ESI): 하드 드라이브, 온라인 소셜 네트워크, PDA, 스마트폰, 음성사서함, 문자 메시징 애플리케이션 및 기타 전자 데이터 저장소에서 발견되는 데이터입니다. 미국 연방 민사소송규칙(Federal Rules of Civil Procedure, FRCP)에서는 ESI를 컴퓨터 하드웨어와 소프트웨어 사용이 필요하며, 디지털 형태로 생성·조작·전달·저장되고 가장 잘 활용되는 정보로 정의합니다.
- 이메일: Microsoft Outlook 또는 Google Gmail과 같은 애플리케이션을 사용해 전송하거나 수신하는 전자 메시지.
- 필터링: 데이터 범위나 데이터 유형과 같은 지정된 매개변수에 맞지 않는 문서를 제거하여 데이터 세트를 축소하는 것.
- 포렌식(Forensics): Computer forensics 을(를) 참조하세요.
- FRCP (Federal Rules of Civil Procedure: 민사소송의 연방규칙): 미국 연방지방법원에서 심리되는 대부분의 민사 사건에 적용되는 규칙으로, 전자적 증거개시(e-discovery)와 ESI(전자적 저장 정보)의 취급에 관한 규정이 포함됩니다.
- 수집(Harvesting): 조사 또는 소송에 사용하기 위해 전자 데이터를 수집하는 것으로, 가능하면 파일 및 시스템 메타데이터를 유지하는 것이 바람직합니다.
- 해시: 전자 문서를 검증하기 위해 값을 생성하는 알고리즘. 해시 마크는 디지털 지문 역할을 합니다.
- 호스팅: eDiscovery에서, 제3자 소송 지원 업체가 제공하는 서비스로서 검토 소프트웨어 플랫폼 내에서 특정 사건과 관련된 문서에 대한 접근을 제공합니다.
- 이미지(드라이브) (미러 이미지 또는 미러링): 하드 드라이브의 빈 공간까지 포함한 동일한 사본.
- 이미지(파일): 문서의 그림(이미지) 형태 사본. eDiscovery 에서 가장 일반적인 형식은 TIFF와 PDF입니다.
- 키워드 검색: 특정 문자열을 포함하는 문서를 찾는 과정입니다. 일반적인 키워드 검색은 지정한 정확한 문자열만 일치시키는 반면, 대부분의 소송 지원 검색 엔진은 어간 추출(stemming)을 사용해 추가 결과를 반환합니다.
- 레거시 데이터: 더 이상 사용되지 않거나 구식이 된 소프트웨어나 하드웨어에 저장된 정보, 또는 형식이 더 이상 사용되지 않게 된 데이터.
- 소송 보존 조치 (법적 보존 조치, 보존 명령, 보존 명령서, 중지 명령, 동결 통지, 보존 통지, 파기 중지 통지): 증거 인멸(spoliation of evidence)을 방지하기 위해 조직에 대해 기록의 일반적인 처리(예: 백업 테이프 재활용)를 중단하도록 법률 대리인이 보내는 통지 또는 커뮤니케이션.
- 로드 파일: 문서의 이미지(스캔본 등)를 전자 디스커버리 플랫폼으로 가져오기 위해 사용되는 파일이며, 문서를 검색 가능 상태로 유지하는 데 필요한 해당 텍스트 및 메타데이터 파일도 함께 포함합니다. 현재는 많은 문서 검토 플랫폼이 문서를 원본 형식(native format)으로 직접 가져올 수 있어 로드 파일이 불필요한 경우가 많습니다.
- 매체: 전자 정보가 저장되는 장치로, 예를 들어 하드 드라이브와 백업 테이프가 있습니다.
- 메타데이터: 전자 파일 안에 포함된 데이터로, 생성·편집·처리 방식과 시점, 작성자(누가 만들었는지) 등 해당 파일에 대한 정보를 제공하거나, 포함된 데이터 유형을 나타냅니다.
- 거울 이미지: 참조 이미지(드라이브).
- 네이티브 형식: 전자 파일이 처음 생성될 때 사용된 형식입니다. 네이티브 파일 형식은 메타데이터와 기타 세부 정보를 보존하며, 로드 파일을 사용하는 경우처럼 문서를 다른 형식으로 변환할 때 손실될 수 있는 내용을 유지합니다.
- 거의 동일본: 다른 문서와 매우 유사한 문서입니다. 거의 동일본은 검토와 관련된 시간과 비용을 줄이기 위해 데이터 축소 과정에서 식별됩니다.
- 정규화: 데이터를 표준 형식으로 다시 포맷팅하는 과정입니다.
- 광학 문자 인식(Optical character recognition (OCR)): 스캔한 문서를 검색 가능한 텍스트로 변환하는 과정입니다.
- 부모 문서: 한 세트에 포함된 다른 문서 및 파일이 연결(첨부)되는 기본 문서입니다. 참고로 자식 문서.
- 정밀도: 쿼리가 문서가 관련(응답)될 가능성을 얼마나 정확하게 예측하는지를 나타내는 지표입니다. 정밀도가 낮으면 관련이 없는 문서가 많이 생성되었음을 의미합니다. 정밀도가 높으면 생성된 문서의 대부분이 관련이 있음을 의미하지만, 모든 관련 문서가 제공되었음을 보장하지는 않습니다. 또한 재현율을 참조하세요.
- 예측 코딩: 비(非)관련(응답 불가) 문서의 수를 줄이기 위한 프로세스입니다. 종종 머신러닝, 키워드 검색, 필터링, 샘플링을 조합해 사용합니다.
- 특권: 특정한 법적 이익 또는 권리를 의미합니다. 예를 들어, 개인과 변호사 사이의 특정한 커뮤니케이션은 공개로부터 보호됩니다.
- 처리: 데이터를 수집(ingestion)하고 그 후속 처리를 수행하는 과정입니다. 흔히 PST 및 ZIP 아카이브에서 파일을 추출하고, 첨부파일을 분리하며, 검토 도구가 읽을 수 있는 형식으로 파일을 변환하고, 텍스트 및 메타데이터를 추출한 다음 데이터 정규화를 수행합니다.
- 제출(Production): 조사 요청의 기준을 충족하는 ESI를, 적절한 형태로 제공하고 적절한 전달 메커니즘을 사용하여 상대방 변호인 또는 요청 당사자에게 전달하는 행위.
- PST: Outlook 및 Windows Messaging과 같은 Microsoft 제품에서 메시지, 일정 이벤트 및 기타 항목을 저장하는 데 사용되는 파일 형식입니다. 또한 이러한 파일 자체를 지칭하는 데도 흔히 사용됩니다(“PSTs”).
- 리콜(Recall): 쿼리가 응답 문서를 얼마나 잘 식별하는지를 나타내는 지표입니다. 리콜 점수 100%는 해당 쿼리가 컬렉션 내의 모든 응답 문서를 반환했음을 의미합니다. 리콜 점수가 낮으면 응답 문서가 비응답 문서로 부적절하게 제외되었음을 의미합니다. 또한 Precision도 참조하세요.
- 기록 관리(Records management): 증거를 제공하는 문서, 역사적 가치가 있는 문서, 또는 기타 비즈니스상의 이점을 제공하는 문서 등처럼 조직에 지속적인 관리 가치가 있을 정도로 중요한 디지털 또는 종이 문서를 대상으로, 체계적으로 감독하고 관리하는 활동입니다.
- 열람 차단/가림(Redaction): 문서에서 특권(privileged), 독점(proprietary) 또는 기밀(confidential) 정보를 해당 정보 위에 검은 영역을 덮는 방식으로 제거하는 과정입니다.
- 응답성: 문서가 요청에 대해 관련성이 있는지를 나타내는 척도입니다.
- 검색: 특정 기준(쿼리)을 사용해 데이터 세트 안에서 용어를 찾아내는 과정입니다. 검색은 단순 키워드로 수행할 수도 있고, 쿼리 용어가 문서에 존재하지 않더라도 쿼리와 관련된 문서를 식별하는 개념 검색으로 수행할 수도 있습니다.
- 슬랙 공간: 데이터가 할당된 공간을 완전히 채우지 못할 때 존재하는 사용되지 않은 공간입니다. 슬랙 공간에는 현재 레코드와 동일한 물리적 위치에 저장되어 있던 이전 레코드의 정보, 메타데이터 조각, 그리고 컴퓨터 시스템의 포렌식 분석에 유용한 기타 정보가 포함될 수 있습니다.
- 소셜 디스커버리: Facebook, Twitter, YouTube, LinkedIn, Instagram 같은 소셜 미디어 플랫폼에서 ESI를 찾아내는 과정입니다.
- 스폴리에이션(Spoliation): 진행 중이거나 예상되는 소송, 정부 조사 또는 감사와 관련될 수 있는 데이터를 변경, 삭제하거나 부분적으로 파괴하는 행위를 말합니다. 증거가 될 수 있는 정보를 보존하지 못하는 경우도 스폴리에이션에 해당합니다.
- 어간 추출(Stemming): 지정된 문자열에 대한 일치 결과뿐만 아니라 해당 문자열의 문법적 변형까지 함께 반환하는 키워드 검색 기법입니다. 예를 들어, 어간 추출을 사용하면 “related”라는 키워드로 검색할 때 “relating”, “relates” 또는 “relate”가 포함된 문서도 함께 반환됩니다.
- 구조화 데이터(Structured data): 관계형 데이터베이스에 저장되며, 데이터 간의 관계를 인식하도록 구조화된 데이터입니다. 참고: 비구조화 데이터(Unstructured data).
- 시스템 파일(System files): 컴퓨터가 생성한 전자 파일로, 운영 체제 또는 기타 제어 프로그램의 일부입니다. Windows 컴퓨터에서 가장 널리 사용되는 시스템 파일로는 msdos.sys, io.sys, ntdetect.com, ntldr 등이 있습니다.
- 태깅(Tagging): 문서에 분류 태그를 할당하는 과정입니다.
- 스레드(Thread, 이메일 문자열 또는 체인): 시작(발신) 이메일과 모든 회신 및 전달 내용을 의미합니다.
- TIFF (Tagged Image Format): 널리 사용되는 그래픽 파일 형식입니다. 이 형식과 관련된 파일 확장자는 .tif입니다. 스캔한 문서는 종종 TIFF 이미지로 저장됩니다.
- 할당되지 않은 공간: 새 데이터를 저장할 수 있는 하드 드라이브의 공간입니다. 특정 파일이 삭제 대상으로 표시되면 해당 공간은 할당되지 않은 공간으로 표시되지만, 데이터가 덮어쓰기되기 전까지는 여전히 검색(복구)될 수 있습니다.
- 유니코드: 전 세계 모든 언어의 문자 집합을 일관된 디지털 표현으로 제공하는 표준입니다. 유니코드는 어떤 언어의 텍스트든 저장하고 검색할 수 있도록 통일된 방법을 제공합니다.
- 단위화: 이미지를 논리적 경계에 따라 분석한 뒤, 여러 개의 하위 문서로 분해하는 과정입니다.
- 비정형 데이터: 구성 요소 간의 의미 있는 관계를 식별할 수 있도록 정리되고 라벨이 지정되지 않은 정보입니다. 예를 들어 텍스트 파일, 서버 및 애플리케이션 로그, 이미지, 오디오 및 비디오 파일, 이메일 등이 있습니다. 또한 정형 데이터.
공유하기
더 알아보기
저자 소개
Dirk Schrader
보안 연구 부문 VP
Dirk Schrader는 Netwrix의 레지던트 CISO(EMEA)이며 보안 연구 부문 VP입니다. CISSP (ISC²) 및 CISM (ISACA) 자격증을 보유한 IT 보안 분야 25년 경력의 베테랑으로, 사이버 위협에 대응하는 현대적 접근 방식으로서 사이버 복원력을 발전시키기 위해 노력하고 있습니다. Dirk는 커리어 초기에 기술 및 지원 역할에서 시작해, 이후 대규모 다국적 기업과 소규모 스타트업 모두에서 영업, 마케팅, 제품 관리 직무로 자리를 옮기며 전 세계의 사이버보안 프로젝트에 참여해 왔습니다. 그는 사이버 복원력을 달성하기 위해 변화 관리와 취약점 관리의 필요성을 다룬 수많은 글을 게재해 왔습니다.