본문 바로가기
AI

2026 생성형 AI 학습데이터 저작권|공정이용 4요소·이용허락·분쟁 예방

by GINOV 2026. 8. 28.

 

2026 생성형 AI 학습데이터 저작권 · 공정이용 4요소·이용허락·분쟁 예방 대표이미지

생성형 AI가 저작물을 학습한다고 해서 곧바로 공정이용이 되거나, 반대로 모든 학습이 곧바로 침해가 되는 것은 아닙니다. 수집·전처리·학습·평가 과정의 복제 가능성을 먼저 확인하고, 이용허락 여부와 저작권법 제35조의5의 네 가지 요소를 실제 데이터·접근 방식·출력 통제·시장 영향에 맞춰 함께 판단해야 합니다.

작성 기준일: 2026년 8월 28일 · 대한민국 저작권법과 2026년 2월 공식 안내서 기준

먼저 보는 판단 결론

  • 공개된 글열람 가능과 AI 학습 허락은 다릅니다. 약관·권리표시·robots.txt·접근 경위를 확인합니다.
  • 구매한 자료소유권과 복제 허락은 다릅니다. AI 학습 범위가 계약에 포함됐는지 봅니다.
  • 공정이용 주장네 요소를 종합 판단합니다. 법원이 개별 사실관계에 따라 최종 판단합니다.

공정이용은 자동 면허가 아닙니다

문화체육관광부·한국저작권위원회의 2026년 2월 안내서는 판단을 돕는 참고자료이며 유권해석이나 개별 사건의 결론이 아닙니다. 안내서의 유리·불리 사례도 사실관계를 단순화한 예시입니다. 최종 결론은 분쟁이 된 개별 사안에서 법원이 내립니다.

1. AI 학습은 결과물보다 앞선 ‘복제 단계’부터 봅니다

공식 안내서는 생성형 AI 학습을 데이터 수집 → 전처리 → 모델 학습 → 평가·최적화의 연속 과정으로 설명합니다. 웹에서 자료를 내려받아 저장하고, 토큰화·정규화하며, 반복 입력하거나 평가용 데이터로 처리하는 과정에서 저작물 전체 또는 일부가 저장될 수 있습니다.

저작권법상 복제는 일시적 또는 영구적으로 유형물에 고정하거나 다시 제작하는 행위를 포함합니다. 따라서 최종 모델이 원문을 그대로 보여주지 않더라도, 학습 준비와 처리 과정에서 보호되는 표현이 저장됐다면 복제권 검토가 필요합니다.

보호대상 저작물인가 → 복제·변형이 있었나 → 이용허락 또는 제한·예외가 있는가 → 공정이용 네 요소는 어떻게 작용하는가

처음에 분리할 세 가지

  • 비보호·보호기간 만료·자유이용 저작물: 적용 조건과 제3자 권리가 남아 있는지 확인합니다.
  • 라이선스를 받은 저작물: AI 학습, 상업 이용, 재제공, 보관 기간이 허락 범위에 포함되는지 확인합니다.
  • 허락이 없는 보호 저작물: 개별 제한 규정 또는 제35조의5 공정이용으로 정당화되는지 별도 검토합니다.

2. 공정이용 네 요소는 한꺼번에 저울질합니다

저작권법 제35조의5는 저작물의 일반적인 이용 방법과 충돌하지 않고 저작자의 정당한 이익을 부당하게 해치지 않는지를 전제로, 아래 4개 요소 등을 종합적으로 고려하도록 합니다. 어느 하나가 유리하다고 자동으로 결론이 나지 않으며, 이용 경위와 방법 같은 추가 사정도 고려될 수 있습니다.

생성형 AI 학습데이터 공정이용 네 요소 실무 판단표
법정 요소 유리하게 작용할 수 있는 사정 불리하게 작용할 수 있는 사정 남길 기록
1. 이용 목적·성격 원저작물과 다른 목적·효용, 비영리 연구, 재현 요청 차단, 적법한 접근 동일 표현·용도의 결과물, 직접 시장 경쟁, 접근 제한 우회, 학습 거부 표시 무시 모델 목적, 영리 구조, 수집 경로, 차단·필터 시험
2. 저작물 종류·용도 사실·정보·기능 중심, 목적에 맞게 공개된 자료 창작성이 높은 문학·예술물, 미공표물, 구독·유료 콘텐츠 자료 유형, 공표 여부, 창작성, 접근 조건
3. 이용 비중·중요성 목적 달성에 합리적으로 필요한 범위, 전체 이용이 기술적으로 불가피한 사정 필요 범위를 넘는 전체 복제, 핵심 표현 집중 이용·재현 샘플링 기준, 제외 규칙, 전체 이용 필요성
4. 시장·가치 영향 원문 판매·열람을 대체하지 않고 이용허락 기회를 훼손하지 않음 구독·광고·판매 감소, 원저작물 대체, 현재·잠재적 AI 학습 라이선스 시장 침해 출력 유사도, 원문 접근 변화, 라이선스 시장 조사

영리 목적만으로 공정이용이 배제되는 것은 아니지만, 영리성과 권리자의 경제적 이익 침해가 직접 맞물리면 불리할 수 있습니다. 반대로 변형적 목적도 공익성과 별개이고, 적법하지 않은 수집 방식이나 시장 대체 위험을 상쇄하는 만능 기준이 아닙니다.

3. 공개글·구매자료·robots.txt·유료DB는 이렇게 구분합니다

학습데이터 출처별 확인 사항과 위험 신호
데이터 출처 자동으로 인정되지 않는 것 확인할 내용
공개 웹 게시물 누구나 읽을 수 있다는 이유만으로 AI 학습 허락이나 공정이용이 자동 인정되지 않음 저작권·라이선스 표시, 이용약관, 수집 목적·규모, 창작성, 출력 대체 가능성
robots.txt로 수집 거부 한국 공정이용의 단일 법정 옵트아웃 규정이라고 단정할 수 없음 권리자의 명시적 거부를 무시한 수집 경위가 불리하게 고려될 수 있으므로 수집 제외와 로그 보존
구매 도서·파일 유형물·파일을 샀다는 사실만으로 복제권 또는 AI 학습 허락까지 취득한 것은 아님 구매 약관, 학습 목적 허락, 보유·복제 범위, 결과물 통제와 시장 영향
구독 서비스·유료DB 로그인·결제로 열람권을 얻었다고 대량 수집·재학습 권한이 생기지 않음 계정 약관, API·다운로드 한도, 기술적 보호조치, AI 학습 라이선스 시장
제3자 구매 데이터셋 판매자가 파일을 보유했다는 사실만으로 모든 구성 저작물의 학습권한이 보장되지 않음 권리 연쇄, AI 학습·상업화·재허락 범위, 삭제 요구, 보증·배상 조항

기술적 보호조치 우회는 별도 위험입니다

페이월, 로그인 제한, 접근 제어를 우회해 수집하면 공정이용 제1요소에 불리할 수 있고, 저작권법상 기술적 보호조치 관련 규정이나 계약·부정경쟁 등 별도 쟁점도 생길 수 있습니다. 수집 가능 여부와 공정이용 여부를 한 질문으로 합치지 마세요.

4. 유리한 사례와 불리한 사례를 대조합니다

다음은 공식 안내서의 판단 구조를 실무용으로 재구성한 예시입니다. 실제 결론은 데이터 구성, 모델 목적, 접근 방식, 출력과 시장 영향에 따라 달라집니다.

유리 가능성|공공데이터 기반 비영리 분석

권리 조건을 확인한 공공데이터를 사회문제 연구용으로 사용하고, 필요한 범위만 처리하며 원저작물 시장을 대체하지 않는다면 여러 요소가 유리할 수 있습니다.

유리 가능성|논문 데이터 분석 보조

적법하게 공개된 논문에서 표현을 재현하는 대신 데이터 분석 방법을 개발하고, 원문 이용을 대체하지 않도록 설계했다면 변형 목적과 낮은 시장 영향이 유리할 수 있습니다.

불리 가능성|무단 기사 요약 서비스

기사 원문 전체를 무단 수집해 핵심 내용을 대신 제공하고 언론사의 구독·광고 시장과 경쟁한다면 목적·양·시장 영향에서 불리할 가능성이 큽니다.

불리 가능성|유료 스톡 이미지 생성

접근 제한·워터마크·robots.txt를 무시해 유료 이미지를 대량 수집하고 같은 이미지 시장에 판매한다면 적법한 접근과 시장 대체 측면에서 불리할 수 있습니다.

합법적으로 구매한 자료도 결과가 같은 용도의 교재·문제집·음악·이미지를 만들어 기존 시장과 경쟁한다면 불리할 수 있습니다. 반대로 전체 이용이 있었다고 해도 목적상 기술적으로 불가피하고 출력이 원저작물을 재현·대체하지 않는다는 사실이 입증되면 다른 요소와 함께 달리 평가될 여지가 있습니다.

5. 학습 전에 남겨야 할 기록 체크리스트

  1. 데이터 목록과 권리 상태를 만듭니다.
    출처 URL, 수집일, 저작물 유형, 공표 여부, 라이선스, 권리자와 제공자를 데이터셋 단위로 기록합니다.
  2. 접근 경위를 보존합니다.
    약관 버전, robots.txt 확인 시각, 로그인·구독 여부, API 조건, 다운로드 방법과 기술적 제한을 캡처합니다.
  3. 학습 목적과 최소 범위를 문서화합니다.
    원저작물과 다른 목적이 무엇인지, 왜 전체 또는 해당 분량이 필요한지, 제외·중복 제거 기준을 적습니다.
  4. 출력 재현 위험을 시험합니다.
    긴 문장·이미지·음악의 실질적 재현, 특정 작품 요청, 멤버십 추론과 훈련데이터 추출 가능성을 점검하고 차단 결과를 남깁니다.
  5. 현재·잠재 시장을 조사합니다.
    기존 판매·구독·광고뿐 아니라 AI 학습용 라이선스와 집중관리 계약의 형성 가능성을 확인합니다.
  6. 삭제·이의제기·감사 절차를 준비합니다.
    권리자 요청 접수, 데이터 추적·제외, 모델 버전 관리, 재학습 판단, 담당자와 승인 이력을 연결합니다.

최소 보존 묶음

  • 데이터셋 명세와 파일 해시, 출처·수집 시각
  • 라이선스·계약서·약관·권리표시 사본
  • 수집 허용·제외 규칙과 robots.txt 처리 로그
  • 중복 제거·필터링·보관·삭제 정책
  • 출력 유사성 테스트와 차단 장치 결과
  • 법무·보안·개인정보 검토와 최종 승인 기록

6. 불확실하면 이용허락 범위를 먼저 구체화합니다

다른 사람의 저작물을 이용할 때는 권리자에게 허락받는 것이 원칙입니다. 허락 계약에는 특별한 형식이 필수인 것은 아니지만, 분쟁을 줄이려면 누가 어떤 권리를 어떤 데이터와 모델에 어느 기간·지역·목적으로 허락하는지를 문서로 남겨야 합니다.

AI 학습데이터 이용허락 계약에서 확인할 핵심 조항
계약 항목 확인 질문
권리와 데이터제공자가 복제·전송·학습을 허락할 권한을 실제 보유하는가?
이용 범위연구·상업화·미세조정·평가·출력 생성·제3자 제공 중 어디까지인가?
모델과 결과물특정 모델·버전만인가, 파생 모델과 출력의 배포·판매도 포함하는가?
보관과 종료원본·전처리본 보관기간, 계약 종료·권리자 요청 시 삭제와 이미 학습된 모델 처리는 어떻게 하는가?
대가·투명성정액·사용량·수익배분 기준, 사용 내역 보고와 감사권은 무엇인가?
보증·분쟁제3자 권리 침해 시 책임, 면책, 준거법, 관할과 조정 절차는 무엇인가?

제3자가 “AI용 데이터”라고 표시해도 구성 저작물마다 권리 연쇄가 끊길 수 있습니다. 표본을 직접 확인하고, 재허락 권한·출처 증빙·권리자 이의제기 처리·배상 범위를 계약서와 데이터 명세에서 함께 대조하세요.

7. 경고장·삭제 요구·분쟁이 생기면 이렇게 대응합니다

  1. 관련 이용을 보존 가능한 방식으로 중단·동결합니다.
    추가 수집과 배포를 멈추되 로그·계약·모델 버전 등 증거를 임의 삭제하거나 덮어쓰지 않습니다.
  2. 대상 저작물과 이용 경로를 특정합니다.
    어떤 파일이 언제 어디서 수집되어 어떤 학습·평가·출력에 쓰였는지 추적합니다.
  3. 허락 범위와 네 요소를 다시 검토합니다.
    권리 귀속, 접근 적법성, 이용 목적·양, 출력 재현과 현재·잠재 시장 영향을 사실별로 정리합니다.
  4. 필요한 임시조치를 시행합니다.
    데이터 제외, 접근 차단, 문제 출력 필터, 판매·배포 중단과 권리자 회신 기한을 정합니다.
  5. 전문 상담과 조정을 활용합니다.
    한국저작권위원회 대표전화 1800-5455에서 연결번호 0번으로 AI 저작권 상담을 받을 수 있고, 합의가 필요하면 저작권 분쟁조정을 검토할 수 있습니다.

“공정이용입니다”라는 한 문장만 회신하지 마세요

공정이용은 개별 사실관계의 종합 판단입니다. 데이터 출처·허락·수집방법·필요 범위·출력 시험·시장 영향 자료를 먼저 모으고, 삭제 요구와 모델 영향 범위를 기술 담당자와 법률 담당자가 함께 확인한 뒤 대응하세요.

8. 자주 묻는 질문

Q1. 인터넷에 공개된 글은 허락 없이 학습해도 되나요?

자동으로 허용되는 것은 아닙니다. 공개 여부는 여러 사정 중 하나이며, 저작물의 성격, 약관·권리표시·robots.txt, 수집 규모와 방법, 출력의 재현·시장 대체 가능성을 함께 봐야 합니다.

Q2. 자료를 정식 구매했으면 AI 학습 복제도 허용되나요?

구매한 유형물이나 파일의 소유·열람권과 저작권자의 복제 허락은 다릅니다. 계약에 AI 학습 범위가 없으면 별도 허락 또는 저작권 제한·예외 적용 가능성을 검토해야 합니다.

Q3. robots.txt를 어기면 곧바로 저작권 침해인가요?

그 사실 하나만으로 모든 법적 결론이 자동 확정되지는 않습니다. 다만 권리자의 학습 거부 표시를 무시한 수집 경위는 공정이용에 불리할 수 있고, 약관 위반·접근통제 우회 등 별도 쟁점이 생길 수 있습니다.

Q4. 비영리 연구라면 전부 공정이용인가요?

아닙니다. 비영리·연구 목적은 유리할 수 있지만, 창작성이 높은 자료의 과도한 복제, 부적법한 접근, 핵심 표현 재현, 이용허락 시장 침해가 있으면 다른 요소에서 불리할 수 있습니다.

Q5. 저작물 전체를 학습하면 무조건 공정이용이 아닌가요?

전체 이용은 제3요소에서 불리할 수 있습니다. 다만 목적 달성을 위해 기술적으로 불가피하고 합리적으로 필요한 범위였는지, 출력과 시장 영향이 어떤지에 따라 종합 판단이 달라질 수 있습니다.

Q6. 원문이 출력되지 않으면 저작권 문제도 없나요?

그렇지 않습니다. 수집·저장·전처리·학습·평가 과정에 복제가 수반될 수 있습니다. 원문 재현이 없다는 점은 목적과 시장 영향 판단에 유리할 수 있지만 학습 단계 검토를 없애지는 않습니다.

Q7. 공정이용 네 요소 중 몇 개가 유리해야 하나요?

법에 정해진 점수나 통과 개수는 없습니다. 요소별 중요도와 추가 사정을 개별 사실관계에 맞춰 종합하고, 최종적으로 법원이 판단합니다.

Q8. 분쟁이 생기면 소송 전에 이용할 창구가 있나요?

한국저작권위원회 AI 상담을 이용할 수 있고, 당사자 간 합의가 필요하면 저작권 분쟁조정을 신청할 수 있습니다. 조정 성립 시 조정조서는 재판상 화해와 같은 효력이 있습니다.

핵심 요약

복제부터 확인

수집·전처리·학습·평가에서 저장이 생기면 복제권 검토가 필요합니다.

공개·구매와 허락 분리

열람 가능성이나 구매 사실만으로 AI 학습 허락이 자동으로 생기지 않습니다.

네 요소 종합

목적·성격, 종류·용도, 비중·중요성, 시장·가치를 함께 판단합니다.

증거를 먼저 남김

출처·약관·robots.txt·라이선스·필터 시험·시장 조사와 승인 이력을 보존합니다.

공식 원문 확인

기준 안내: 이 글은 2026년 8월 28일 확인한 현행 저작권법과 2026년 2월 26일 발행 공식 안내서를 기준으로 작성했습니다. 안내서는 유권해석이 아니며, AI 학습의 공정이용 여부는 데이터·계약·접근 방식·모델·출력·시장 등 개별 사실관계에 따라 법원이 최종 판단합니다. 실제 사업·분쟁은 한국저작권위원회 AI 상담과 변호사 등 전문가에게 자료를 제시해 확인하세요.

콘텐츠 작성·검수 안내: GINOV가 최초 작성일과 최종 수정일을 2026년 8월 28일로 기록하고, 본문 외부 공식 근거 4건의 법령·발간 상태·안내서 페이지를 대조해 작성·검수했습니다. 오류·정정 제보는 블로그 문의하기를 이용해 주세요.