생성형 AI(GenAI) 학습 데이터 유출은 공격 및 사고로 인해 발생합니다. 데이터 유출을 방지하고 영향을 줄이는 방법을 알아보세요.
이 글을 읽은 후에 다음을 할 수 있습니다:
글 링크 복사
생성형 AI(GenAI)는 조직이 생산성을 높이고, 더 나은 의사 결정을 내리고, 훨씬 더 빠르게 움직이는 데 도움이 될 수 있습니다. 그러나 이는 조직에서 사용하는 대규모 언어 모델(LLM)이 방대한 양의 고품질 관련 데이터로 학습된 경우에만 가능합니다. 대부분 회사에서 이 학습 데이터는 가장 소중한 지적 재산 중 일부입니다. 해당 데이터를 내부 또는 외부 생성형 AI 모델에 안전하게 도입하려면 위험 식별 및 완화를 위한 전체적인 접근 방식이 필요합니다.
생성형 AI는 딥러닝 모델을 사용하여 주로 텍스트, 이미지, 오디오, 비디오 또는 컴퓨터 코드와 같은 콘텐츠를 생성합니다. 이를 위해 이러한 모델들은 방대한 양의 원시 학습 데이터를 기반으로 학습되며, 이 데이터는 보통 모델이 출력하게 될 데이터의 형태를 띱니다. 다시 말해, 텍스트 생성 모델은 텍스트로, 동영상 생성 모델은 동영상 등으로 학습합니다.
알고리즘에 따라, 모델은 학습 데이터를 검색하고 분석하여 관련된 개념, 이미지 또는 패턴을 찾습니다. 모델은 반복적인 학습과 조정을 거치면서, 분석을 통해 학습한 내용을 바탕으로 사용자 프롬프트에 새롭고 적절한 콘텐츠를 신속하게 제공합니다.
음악이 좋은 비유가 될 수 있습니다. 멜로디 스케일, 코드 구성, 기존 곡이나 작품들이 바로 학습 데이터입니다. 음악가(즉, 생성형 AI 모델)는 이를 공부하여 효과적인 패턴을 파악하고, 새로운 솔로, 코드 진행, 곡(생성형 AI의 출력물)을 만들어냅니다.
기업 IT의 경우 조직이 자체 학습 데이터를 활용해 생성형 AI 모델을 만들거나, 기존 모델을 특정 업무에 맞게 미세 조정하는 경우가 많습니다. 학습 데이터의 대표적인 출처는 다음과 같습니다.
생성형 모델은 규모에 의존하기 때문에, 많은 조직이 내부 데이터와 외부 데이터를 함께 활용합니다. 하지만 보안 측면에서는 이 조합이 위험할 수 있습니다. 내부 데이터는 보통 더 철저히 검증되지만, 민감하거나 독점적인 정보를 외부 데이터와 섞으면, 현대적 역공학이나 프롬프트 기반 공격을 통해 다운스트림 유출 경로가 새로 생겨날 수 있습니다.
학습 데이터 유출은 모델의 학습 데이터에 포함된 민감하거나 개인적, 독점적 정보가 모델 출력, 추론 쿼리, 로그, 혹은 임베딩 같은 부수적 산출물을 통해 직접적이거나 간접적으로 노출될 때 발생합니다. “기억 유출”은 모델이 학습 데이터의 일부를 그대로 출력할 때 나타나는 학습 데이터 유출의 한 유형입니다.
생성형 AI 라이프사이클의 여러 지점에서 유출이 발생할 수 있습니다.
조직, 특히 민감하거나 규제 대상인 데이터를 취급하는 조직이 다른 IT 자산과 동일한 수준으로 AI 파이프라인을 보호해야 하는 이유는 여러 가지입니다.
AI 프로젝트는 고객 데이터, 재무 기록, 법률 계약, 영업 기밀, 소스 코드 등 내부, 독점 또는 규제 대상 데이터에 자주 의존합니다. 해당 모델이 개인 식별 정보(PII)나 영업 비밀을 유출하면 그 피해가 심각할 수 있습니다. 이러한 정보 유출은 개인 정보 도용, 경쟁적 노출, 규제 벌금, 평판 손상 및 IP 도난으로 이어질 수도 있습니다.
단편적인 정보(예: 이름, 주소, 작은 코드 스니펫)만 유출되더라도, 이러한 정보가 모이거나 외부 데이터와 연관되어 더 큰 침해 사고로 이어질 수 있습니다.
유럽의 일반 데이터 보호 규정(GDPR), 캘리포니아 소비자 개인 정보 보호법(CCPA), 미국의 건강 보험 양도 및 책임에 관한 법(HIPAA) 등의 산업별 규칙 등데이터 개인정보 보호법에서는 개인 데이터 처리, 최소화, 동의, 유출 통보 등에 관한 엄격한 의무를 부과합니다. 개인 식별 정보(PII)나 개인 속성을 유출하는 모델은 조직이 관련 법규를 위반하게 만들 수 있으며, 이에 따라 벌금, 보고 의무, 감사, 집단 소송 책임 등이 발생할 수 있습니다.
모델 학습 데이터에 대한 주요 위협은 악성 공격, AI 사용에 대한 가시성 부족으로 인한 위협, 그리고 API 및 엔드포인트 취약성의 세 가지 광범위한 범주로 분류됩니다.
내부자 공격: 내부자 위협은 고전적인 문제입니다. 권한을 가진 개발자, ML 엔지니어, 데이터 과학자가 의도적으로 학습 데이터를 유출하거나 중요한 샘플을 데이터 세트에 삽입할 수 있습니다. 공격자는 학습 로그, 파라미터 덤프, 프롬프트 로그 또는 중간 결과물에 접근하여 민감한 콘텐츠를 추출하거나 재구성할 수 있습니다. 이러한 팀 구성원은 합법적인 접근 권한을 가지고 있는 경우가 많으므로, 악성 행위를 탐지하기 위해서는 강력한 모니터링, 로깅, 그리고 업무 분담이 필요합니다.
모델 역공학 공격: 모델 역공학 공격과 멤버십 추론 공격은 특정 데이터가 학습 세트에 포함되었는지 확인하거나 재구성하려고 시도합니다. 쿼리를 작성하거나 모델의 신뢰도 분포를 탐색하여 공격자는 모델 자체에서 개인 픽셀 수준 데이터(비전 모델) 또는 텍스트 데이터(LLM)를 재구성할 수 있습니다.
즉, 이 “블랙박스” 모델이 공격자에게 민감한 데이터를 회수할 수 있는 창구가 되는 셈입니다.
모델 역전 외에도, 적대적 쿼리 공격, 모델 추출 또는 지속적인 쿼리를 통한 모델 '도용'과 같은 추가적인 위협도 존재합니다.
이는 팀에서 통제되지 않은 방식으로 생성형 AI 도구를 도입하고 사용하면서 비롯되는 위험입니다.
섀도우 AI: “섀도우 AI”란 감독, 검토 또는 중앙 통제와의 통합 없이 AI 도구를 사용하는 것을 의미합니다. 이러한 AI 도구는 내부 문서 또는 데이터를 타사 모델(예: 공개 LLM 등)에 업로드할 수 있으며, 이로 인해 보안팀이 인지하지 못하는 사각지대 및 노출이 발생할 수 있습니다.
부적절한 액세스 제어: 학습 데이터, 임베딩, 프롬프트 로그, 중간 표현, 모델 가중치에 대한 권한이 지나치게 넓으면, 전체 접근이 필요 없는 사용자나 시스템이 민감한 내용을 의도치 않게 보거나 유출할 수 있습니다. 과도한 권한이 부여된 역할 또는 허술한 역할 기반 액세스 제어(RBAC)가 일반적인 근본 원인입니다.
생성형 AI 입력 및 출력에 의한 의도치 않은 노출: 때로는 모델 입력 또는 출력 채널을 통해 실수로 유출이 발생합니다. 학습에 사용되는 내부 프롬프트가 민감한 텍스트를 포함할 수 있으며, 사용자가 부주의하게 독점 콘텐츠를 대화형 모델에 입력할 수도 있습니다. 모델의 출력이 “도움이 되려고” 민감한 입력의 일부를 그대로 되돌려줄 수 있으며, 이 과정에서 다운스트림 시스템에 해당 정보가 노출될 수 있습니다. 마찬가지로, 프롬프트/응답 세션의 로그 또는 아카이브가 의도치 않게 개인 정보의 저장소가 될 수도 있습니다.
모델이 API를 통해 외부에 공개되면 서비스 인프라에 추가적인 위험이 생깁니다. 인증, 레이트 리미팅, 엔드포인트 정제, 입력 필터링이 취약할 경우 공격자는 다음과 같은 공격을 시도할 수 있습니다.
학습 데이터 위험을 줄이기 위해 조직은 기술, 정책 및 조직적 해결책을 통합하는 포괄적인 보안 접근 방식을 취해야 합니다. 이러한 솔루션은 다음과 같은 기능을 갖추어야 합니다.
팀에서 사용하는 AI 모델, 도구 및 애플리케이션을 파악하는 것은 이러한 요소 중 하나가 학습 데이터를 노출할 가능성을 줄이는 첫 번째 단계입니다.
팀에서 사용하는 것을 전체적으로 파악한 후 잠재적인 취약점과 공격 경로를 분석합니다.
인증된 올바른 사용자만이 적절한 시기에 적절한 정보에 접근하도록 해야 합니다.
학습, 검증, 추론에 이르기까지 AI 개발 라이프사이클 전반에서 계층화된 보호를 통해 데이터의 개인 정보 보호 및 무결성을 보장합니다.
AI 학습 데이터를 보호하는 가장 효과적인 방법은 팀이 기존 시스템의 복잡성을 늘리지 않고도 모범 사례를 자연스럽게 적용할 수 있도록 하는 것입니다. Cloudflare AI Security Suite는 가시성과 보안 제어 기능을 제공하여 조직이 생성형 AI 및 에이전틱 AI를 보호하는 접근 방식을 표준화하고 간소화할 수 있도록 지원합니다. 이 통합 플랫폼은 연결성, 네트워크, 애플리케이션 보안 등의 안전한 액세스 서비스 에지(SASE) 기능, 그리고 개발자 도구를 단일 솔루션으로 통합하여 AI 보안 문제를 자신 있게 해결하는 데 도움이 됩니다.
Cloudflare AI Security Suite로 AI 시스템을 보호하는 방법에 대해 자세히 알아보세요.
생성형 AI 모델은 텍스트, 이미지, 비디오와 같은 방대한 양의 원시 데이터로 학습됩니다. 이 학습 데이터는 내부 문서, 고객 서신, 독점 지식 베이스 또는 외부 공개 소스 등 다양한 출처에서 수집됩니다.
학습 데이터 유출은 학습 데이터에 포함된 민감하거나, 사적이거나, 독점적인 콘텐츠가 모델 출력, 로그, 추론 쿼리 또는 보조 결과물을 통해 직간접적으로 노출될 때 발생합니다. 유출은 학습 단계, 추론 단계 또는 분산 학습에서 그래디언트 또는 파라미터 유출을 통해 발생할 수 있습니다.
AI 학습 데이터 보안은 영업 비밀, 고객 데이터, 금융 기록과 같이 가치 있고 독점적이거나 규제 대상인 정보가 학습 과정에 포함될 수 있으므로 매우 중요합니다. 이 데이터가 유출되면 신원 도용, 경쟁 정보 노출, GDPR이나 HIPAA 같은 규제 벌금, 평판 손상, 지적 재산(IP) 탈취 등 심각한 피해가 발생할 수 있습니다.
모델 학습 데이터에 대한 주요 보안 위험은 악의적인 공격, AI 사용에 대한 가시성 부족으로 발생하는 위협, API와 엔드포인트 취약점의 세 가지 큰 카테고리로 나뉩니다. 예시로는 내부자 공격, "섀도우 AI"(통제되지 않은 AI 도구 사용), 그리고 API에 노출된 모델을 대상으로 하는 프롬프트 삽입 공격 등이 있습니다.
모델 역공학 공격은 특정 데이터 포인트가 학습 세트에 포함되었는지 여부를 재구성하거나 확인하려는 시도입니다. 공격자는 쿼리를 만들거나 모델의 신뢰도 분포를 탐색하여 이를 수행합니다. 이는 기본적으로 '블랙 박스' 모델을 개인 텍스트 또는 픽셀 수준 정보와 같은 개인 데이터를 복구하는 렌즈로 사용하는 것과 같습니다.
"섀도우 AI"란 중앙의 감독, 검토 또는 보안 제어 통합 없이 AI 도구를 사용하는 것을 말합니다. 이는 직원들이 승인되지 않은 타사 모델에 내부 문서 또는 데이터를 업로드하여 민감하거나 독점적인 정보가 노출될 수 있기 때문에 보안 팀에게 사각지대를 만듭니다.
학습 데이터 위험을 완화하기 위해 조직은 (1) AI 사용에 대한 가시성 확보, (2) AI 환경에 대한 포괄적인 위험 평가, (3) 철저한 액세스 제어, (4) AI 파이프라인 전반의 데이터 보안 모범 사례를 제공하는 솔루션을 구현해야 합니다.
데이터 최소화 및 익명화, 데이터 정제 및 필터링, 노이즈 주입, 민감한 콘텐츠 차단 또는 정제를 위한 모델 결과 필터링 등의 데이터 안전 모범 사례를 AI 수명 주기 전반에 걸쳐 적용할 수 있습니다.
---시작하기
인공 지능
머신러닝
빅 데이터
용어
학습 센터