Netwrix 1Secure는 데이터와 아이덴티티 전반에 걸쳐 통합된 가시성을 제공합니다 - 14일간 무료로 전체 액세스가 가능합니다.무료 평가판 시작

리소스 센터블로그

AI 재킹(jailbreak) 문제는 사라지지 않으며, 컴플라이언스 프레임워크도 따라잡아야 합니다

AI 재킹(jailbreak) 문제는 사라지지 않으며, 컴플라이언스 프레임워크도 따라잡아야 합니다

Jun 17, 2026

몇 주 전, 미국 정부가 자사의 최첨단 AI 모델 2개에 대한 액세스를 중단하도록 Anthropic에 요구하는 지침을 발표했습니다. Fable 5와 Mythos 5는 보고된 재킹(jailbreak) 기법에 대한 우려를 근거로 한 조치였습니다. Anthropic은 이러한 결과가 그렇게 극적인 대응을 정당화할 만한 것이었는지에 대해 공개적으로 이의를 제기하면서도, 지침에 따랐습니다.

저는 그 특정한 결정을 다시 따지려는 게 아닙니다. 하지만 이번 사건은 업계가 너무 오랫동안 빙빙 돌며 피해 왔던 질문을 강제로 떠올리게 했습니다. 즉, 안전을 가장 중시하는 AI 제공자조차도 완벽한 jailbreak 저항이 가능하지 않을 수 있다는 점을 인정한다면, 우리는 보안 팀에게 정확히 무엇을 방어하라고 기대하는 것이며, 어떤 도구로 방어해야 하는 것일까요?

AI 안전장치에 관한 불편한 진실

대부분의 AI 업체가 솔직히 말하지 않는 사실이 하나 있습니다. 오늘 배포된 모든 모델은 어떤 형태로든 jailbreaking에 취약합니다. 프롬프트 인젝션, 역할극(롤플레이) 공격, 간접 프롬프트 조작, 컨텍스트 드리프트. 이는 이미 문서화되어 있고, 점점 더 자동화되고 있으며, 지금 당장 기업용 AI 배포 환경을 상대로 사용되고 있습니다.

하지만 가장 위험한 jailbreak 공격 경로(벡터) 중 상당수는 모델 자체를 전혀 겨냥하지 않습니다. 그 대신 모델을 둘러싼 인프라를 노립니다. 즉, 구성 파일, 배포 설정, 모니터링 제어, 그리고 운영 환경에서 모델의 동작 방식을 좌우하는 감사 파이프라인입니다.

정답인 안전 제어를 끄고, 정답인 구성 파라미터를 바꾸기만 하면 됩니다. 굳이 교묘한 프롬프트가 필요 없죠. 이미 이긴 겁니다.

이것은 전형적인 구성 무결성(configuration integrity) 문제입니다. 그리고 우리는 그에 대해 정확히 어떻게 생각해야 하는지 알고 있습니다.

AI 인프라 훼손이 실제로 어떤 모습인지

인프라 관점에서 AI 시스템을 보안한다는 말은, 대부분의 조직이 아직 공식적인 변경 관리 대상에 포함시키지 않은 특정 유형의 자산을 보호한다는 뜻입니다:

시스템 프롬프트 파일과 정책 룰셋

많은 엔터프라이즈 AI 배포는 모델의 동작 방식, 콘텐츠 정책, 접근 제한을 정의하는 저장된 시스템 프롬프트 파일에 의존합니다. 이 파일들은 디스크에 있거나 구성 저장소에 있습니다. 또한 파일시스템 접근 권한이 있는 누구나 이를 편집할 수 있는 경우가 많습니다. 시스템 프롬프트의 단 한 가지 지시만 바뀌어도, 모델이 할 수 있는 것과 할 수 없는 것이 근본적으로 달라질 수 있으며, 모델 수준의 보호 장치가 전혀 작동하지 않을 수 있습니다.

모델 배포 구성

온도, 컨텍스트 길이, 도구 접근, 안전 필터 활성화를 제어하는 매개변수는 일반적으로 구성 파일이나 환경 변수에 저장됩니다. 이러한 설정을 무단으로 변경하면 모델 자체를 건드리지 않고도 안전 동작이 억제될 수 있습니다.

안전 필터 및 콘텐츠 정책 설정

많은 AI 플랫폼은 콘텐츠 필터링을 모델과 별도의 계층으로 구현합니다. 이러한 필터는 그 자체가 소프트웨어이며, 구성 파일, 정책 정의, 버전 관리되는 룰셋으로 구성됩니다. 공격자가 이러한 파일을 수정할 수 있다면, 모델이 생성할 결과에 대해 허용 기준을 조용히 낮출 수 있습니다.

모니터링 및 로깅 파이프라인

감사 로그는 그대로 보존되어 있을 때만 유용합니다. 공격자가 AI 시스템의 로깅 구성을 비활성화하거나 수정할 수 있다면, 자신의 활동을 숨기고 포렌식 조사를 훨씬 더 어렵게 만들 수 있습니다.

이러한 공격 경로 중 어떤 것도 정교한 프롬프트를 요구하지 않습니다. 필요한 것은 접근 권한, 기회, 그리고 변경 모니터링의 부재입니다. 구성 무결성 도구가 바로 이 공백을 메우도록 설계된 이유입니다.

Netwrix Change Tracker가 AI 배포를 지원하는 시스템 전반에서 무단 변경을 감지하고 가시성을 유지하는 데 어떻게 도움이 되는지 알아보세요. 데모를 신청하세요.

Change Tracker가 들어맞는 위치

Netwrix Change Tracker는 바로 이런 유형의 문제를 위해 만들어졌습니다. 즉, 중요 시스템 전반에서 검증된 기준선(known-good baseline)을 유지하고, 그 기준선에서 발생하는 모든 편차를 실시간으로 탐지하는 것입니다.

AI 인프라에 적용하면, 이는 다음을 의미합니다:

AI 구성 자산을 위한 파일 무결성 모니터링

Change Tracker는 암호화 해싱을 사용하여 모니터링되는 모든 파일에 대해 검증된 기준선을 설정합니다. 시스템 프롬프트 파일, 안전 정책 정의 또는 모델 구성에 변경이 발생하면(정상적인 업데이트이든 무단 수정이든) Change Tracker가 즉시 이를 감지합니다. 모든 변경 사항은 타임스탬프, 변경을 수행한 사용자 신원, 그리고 변경된 특정 속성과 함께 기록됩니다. 모호함이 없습니다. 누락된 맥락도 없습니다.

Windows에서는 Gen 7 Agent 미니필터 드라이버가 커널 레벨에서 동작하며, Windows Filter Manager 스택에서 altitude 388790에 위치해 파일 I/O 변경 사항을 실시간으로 캡처합니다. 파일을 잠그거나 지연을 추가하지 않습니다. Linux에서는 Sysdig 통합이 시스템 콜 수준에서 누가 변경을 수행했는지 캡처합니다. 어느 쪽이든, 탐지는 지속적이며 포렌식 관점에서 정확합니다.

강화된 기준선을 기반으로 한 보안 구성 관리

CIS Benchmarks 서버 구성을 강화하기 위한 처방형 시작 지점을 조직에 제공합니다. Change Tracker에는 CIS, NIST 800-53, PCI DSS, HIPAA, DISA STIG 등과 매핑된 250개+ 사전 구축 컴플라이언스 보고서가 포함되어 있으며, Windows, Linux, 데이터베이스, 네트워크 장비를 폭넓게 다룹니다. AI 인프라의 경우에도 동일한 강화 원칙이 적용됩니다. 공격 표면을 줄이고, OS 수준에서 최소 권한을 강제하며, 배포한 구성이 실제로 실행 중인 구성과 일치하는지 지속적으로 검증하십시오.

AI 시스템 변경을 위한 폐루프 변경 통제

AI 배포에 대한 정당한 모든 변경은 실제로 발생하기 전에 반드시 승인되어야 합니다. Change Tracker의 폐루프 변경 통제는 ITIL 및 COBIT 원칙과 직접적으로 일치합니다. 계획된 변경 사항은 사전에 문서화되고, 승인된 변경 기간에 대해 추적되며, 관측된 활동과 자동으로 대조·정합됩니다. 승인된 변경 요청과 일치하지 않는 수정인 ‘계획되지 않은 변경’은 즉시 알림으로 드러납니다.

ServiceNow, BMC Remedy 또는 기타 ITSM 플랫폼을 사용하는 팀이라면, Change Tracker의 기본(네이티브) 통합이 변경 요청을 자동으로 가져오고 이를 사용해 감지된 변경을 분류합니다. 승인된 티켓 밖에서 AI 인프라가 변경되면, 당신은 그것을 알게 됩니다. 반대로 티켓 안에서 변경이 이뤄진 경우에는 불필요한 노이즈가 억제되어, 팀은 실제로 중요한 부분에 집중할 수 있습니다.

하이브리드 AI 환경 전반을 아우르는 에이전트 및 에이전트리스 커버리지

AI 인프라는 한 곳에만 존재하지 않습니다. 컴퓨트는 온프레미스에 있을 수 있고, 모델 호스팅은 AWS 또는 Azure에 있을 수 있으며, 구성 관리는 여러 도구를 혼합해 사용할 수도 있습니다. Change Tracker는 Windows와 Linux에서 Gen 7 Agent를 통해 에이전트 기반 모니터링을 지원하고, 에이전트 배포가 현실적이지 않은 시스템에는 SSH와 WMI를 통해 에이전트리스 커버리지를 제공합니다. ESXi 및 클라우드 환경은 PowerCLI 기반 에이전트리스 수집으로 커버합니다. 모니터링 모델은 인프라 모델과 일치합니다.

규정 준수 및 포렌식을 위한 변경 불가능한 감사 로그

AI 시스템에서 무언가 잘못되었을 때—예기치 않은 출력이 발생했거나, 보고된 안전성 실패가 있거나, 인프라가 침해된 것으로 의심되는 경우—첫 번째 질문은 언제나 이것입니다. 무엇이 변경되었나요? Change Tracker는 모니터링되는 모든 시스템에서 발생하는 각 구성 변경 사항에 대해 지속적이고 변조가 드러나는 기록을 유지합니다. 해당 기록은 즉시 확인할 수 있고, 검색 가능하며, 감사 대응에 부합하고 사고 조사를 지원하는 형식으로 내보낼 수 있습니다.

규정이 미치지 못하는 지점

EU AI Act는 의미 있는 진전입니다. NIST의 AI Risk Management Framework도 신중하게 설계되었습니다. 하지만 두 문서 모두 AI 배포를 둘러싼 운영 보안 통제 사항을 충분히 다루지 못하고 있습니다. 보안 팀이 실제로 구현하고 점검(감사)하는 유형의 통제입니다.

제가 주장하고 싶은 것은, 어떤 기업의 AI 배포에도 반드시 기본 수준으로 갖춰야 하는 필수 요구사항이 무엇인지입니다. AI 전용 지침이 아직 완전히 도착하지 않았더라도, CIS Controls는 이미 이 방향을 가리키고 있습니다:

지속적인 구성 모니터링

AI 시스템 구성은 승인되지 않은 변경이 있는지 지속적으로 모니터링해야 합니다. 예: 버전, 파라미터, 가드레일과 같은 온프레미스 모델 배포; 시스템 프롬프트, 신원 파일, 메모리 스토어, 도구 정의와 같은 에이전트 실행 환경; 그리고 MCP 서버, 키 볼트, 자격 증명 저장소, 감사 파이프라인, 스킬 마켓플레이스처럼 에이전트가 인증하고 기록하는 외부 인프라 에이전트 대상. 분기별로 검토하지 않음. 배포 시 확인하지 않음. 지속적으로. 승인된 기준(베이스라인)에서 무언가가 벗어날 때 실시간 알림과 함께.

정식 변경 관리

AI 시스템에 대한 모든 변경은 승인, 문서화, 검토를 반드시 거쳐야 합니다. 단순히 관료적인 부담 때문이 아니라, 계획되지 않은 변경이 공격자와 사고 모두에게 틈을 만들어내기 때문입니다. 폐루프(Closed-loop) 변경 제어는 변경을 위험에서 증거로 전환합니다.

AI 자산을 위한 파일 무결성 모니터링

시스템 프롬프트 파일, 안전 규칙 세트, 모델 구성 파일은 중요 OS 파일과 동일한 무결성 요구사항을 적용해야 합니다. SHA-256 해시 검증. 기준선 비교. 편차 발생 시 즉시 알림. 이는 PCI DSS 준수를 위한 표준 절차입니다. AI 배포에서도 마찬가지로 표준 절차로 적용되어야 합니다.

불변 감사 로그

AI 인프라에 영향을 미치는 모든 관리 작업, 구성 변경, 정책 수정, 보안 이벤트는 쉽게 수정되거나 삭제될 수 없는 방식으로 기록되어야 합니다. 해당 로그는 포렌식(포렌식 조사) 자료이자 컴플라이언스 산출물입니다.

AI 인프라에 대한 최소 권한

AI 배포 환경에 대한 Privileged access는 Active Directory 또는 중요 데이터베이스에 대한 접근을 관리하는 방식과 동일하게 적용되어야 합니다. 즉, 엄격한 통제, 완전한 책임성, 그리고 누가 접근을 가지고 있는지와 그들이 무엇을 수행하는지에 대한 지속적인 모니터링이 필요합니다.

다층 방어의 필수 과제

프롬프트 수준의 보호 조치에 집중하는 것은 중요하지만, 실제로 AI 보안이 의미하는 바에 대해 잘못된 인식을 만들어 왔습니다. 조직들은 통제된 테스트 환경에서 모델이 탈옥(jailbreak)에 얼마나 잘 저항하는지에 따라 AI 공급업체를 평가하면서, 그 주변 인프라는 본질적으로 관리되지 않은 채로 두고 있습니다.

공격자는 이미 이를 알고 있습니다. 그들은 시간을 전부 들여 교묘한 프롬프트를 만드는 데 쓰지 않습니다. 운영 체인의 가장 약한 고리를 찾고 있는 것입니다. 즉, 모니터링되지 않는 구성 파일, 과도한 권한을 가진 서비스 계정, 조용히 비활성화된 안전 필터, 아무도 기록하지 않은 변경 사항입니다.

그것은 모델의 문제가 아닙니다. 구성(configuration)과 변경 통제(change control) 문제입니다. 규제를 받는 워크로드를 운영하는 조직이라면, 이미 쉽게 배포하는 방법을 알고 있는 해결책이 있습니다.

다음에 무엇을 해야 하는가

규제 기관은 더 빠르게 움직여야 하며, 더 구체적으로 움직여야 합니다. AI 거버넌스에 관한 광범위한 원칙은 출발점이 될 수 있지만, 실제로 보안 팀이 필요로 하는 것은 구체적이고 감사 가능한 통제 요구 사항입니다. 즉, 구현하고 테스트하며 지속적으로 검증할 수 있는 수준이어야 합니다.

이미 IT 인프라를 위해 CIS Controls에서 규정하고 있는 내용에 기반해, AI 배포 환경에 대해서는 명시적으로 확장한 의무적 기본 통제는 조직에 실용적인 출발점을 제공하고, 감사자에게 의미 있는 벤치마크를 제공할 것입니다. 구성 모니터링. 변경 관리. 파일 무결성 검증. 감사 추적 요구 사항. 이는 지금까지 마땅히 받아야 할 점검에서 벗어나 있던 맥락에 적용되는, 단지 규율 잡힌 보안 모범 사례일 뿐입니다. 우리는 그러한 솔루션이 어떤 모습인지 알고 있습니다. 도구는 존재합니다. 프레임워크도 존재합니다. 이제 통제를 의무화할 때입니다.

Netwrix Change Tracker

실행 중인 모든 시스템에서 CIS 벤치마크 감사를 수행

자세히 알아보기

자주 묻는 질문(FAQ)

공유하기

더 알아보기

저자 소개

Asset Not Found

Dan Piazza

제품 관리( Product Management ) 매니저

Dan Piazza는 Netwrix의 제품 관리( Product Management ) 매니저로, 여러 Endpoint, DSPM 및 Directory 제품을 담당하고 있습니다. 그는 2013년부터 기술 분야에서 일해 왔으며, 사이버보안, 데이터 보호, 자동화, 코드에 대한 열정을 가지고 있습니다. 현재 직전에는 데이터 스토리지 소프트웨어 회사에서 제품 관리자와 시스템 엔지니어로 근무하며 소프트웨어와 하드웨어 B2B 솔루션을 모두 관리하고 구현했습니다.