핵심 요약
- AI 언어 모델은 인터넷상의 텍스트(동굴 벽에 비친 왜곡된 그림자)에서 앞 단어를 보고 다음 단어를 맞히는 확률적 방식으로 작동하기 때문에, 인간 고유의 실제 경험과 구체적 맥락이 결여되어 있어 ‘인간이 이끄는(Human in the Lead)’ 개입 없이는 평범하고 진부한 결과물(AI 슬롭)만 양산한다.
- 할리우드 각본가 데이비드 고이어는 AI를 창의성을 통째로 외주 주는 대상이 아니라 아이디어를 부딪치는 상대로 활용해 독백 압축 및 액션 시퀀스 브레인스토밍을 수행함으로써 장편 영화 초고 작성 기간을 기존 8~10주에서 4~5주로 단축시켰다.
- AI가 생성한 데이터를 다음 세대 AI가 재귀적으로 학습할 경우 희귀한 아이디어가 소멸하고 오류가 사실처럼 굳어지는 ‘모델 붕괴(Model Collapse)’가 발생하며, 법원 판결(앤트로픽 사건)과 철학적 사고실험(보르헤스의 피에르 메나르)이 보여주듯 맥락과 경험을 지닌 ‘인간이 실제로 작성한 글’의 희소성과 가치는 앞으로 더욱 극대화된다.
주요 내용
1. 플라톤의 동굴과 인터넷 데이터의 왜곡
- 데이비드 고이어는 현재의 AI 모델 학습 방식을 플라톤의 ‘동굴의 비유’에 빗대어 설명합니다. 디지털화된 텍스트, 이미지, 영상 데이터는 실제 세계의 온전한 모습이 아니라 벽에 비친 ‘그림자’에 불과하며, 여전히 수많은 인류의 지식은 디지털화되지 않았습니다.
- 인터넷에 존재하는 데이터는 편향과 왜곡(자극적인 콘텐츠, 성차별·인종차별적 편향 등)이 심합니다. 앤드류 응은 AI 연구진들이 데이터 정제와 RLHF(인간 피드백 기반 강화학습) 등을 통해 AI 모델의 인종·성차별 편향을 일반적인 인간보다 훨씬 낮추는 데 성공했으나, AI 모델이 파악하지 못하는 현실 세계의 방대한 맥락은 여전히 인간만이 채울 수 있다고 설명합니다.
2. 각본가 데이비드 고이어의 실전 AI 워크플로
- 데이비드 고이어는 AI에게 “대본 써줘” 식의 단순 프롬프트를 던지면 가장 진부한 쓰레기 대본이 나온다고 비판하며, 철저히 인간이 주도권을 쥐는 ‘Human in the Lead’ 방식을 사용합니다.
- 긴 대사 압축: 직접 공들여 쓴 4페이지짜리 독백을 AI에 넣고 “맥락은 유지하되 서로 다른 톤앤매너로 40% 분량의 2페이지 버전 6개를 뽑아달라”고 요청합니다. 이후 AI가 1~2분 만에 제시한 버전들 중 좋은 표현을 골라 섞어 씀으로써 기존에 1~2시간 걸리던 대사 다듬기 작업을 5분 만에 완료합니다.
- 장면 브레인스토밍: 특정 고급 상업용 헬리콥터 기종에서 탈출하는 액션 씬을 구상할 때, 기내에 실제로 비치된 물품(헤드폰 선, 안전벨트 등)을 활용해 맥가이버식으로 탈출하는 기발한 방법을 AI와 문답하며 시퀀스를 완성했습니다.
- 제작 기간 단축: 이러한 반복 수정(iteration) 방식으로 장편 영화 초고(Draft) 집필 기간을 8~10주에서 4~5주 수준으로 대폭 단축했습니다.
3. ‘모델 붕괴(Model Collapse)’와 사람 글의 희소성
- 플라톤 동굴의 죄수들이 지나가는 그림자의 순서를 맞히듯, 거대언어모델(LLM)은 앞선 단어를 보고 다음 단어를 맞히는 원리로 작동합니다.
- 학술지 《네이처(Nature)》에 게재된 연구에 따르면, AI가 작성한 글을 다음 세대 AI가 반복적으로 학습(재귀적 학습)하면 세대를 거칠수록 독창적인 아이디어는 사라지고 흔한 문장만 남게 되며, 9세대에 이르러서는 영국 교회 건축에 대한 질문에 ‘산토끼’ 이야기만 반복하는 ‘모델 붕괴’ 현상이 발생합니다.
- 이 모델 붕괴는 매 세대마다 사람이 쓴 원래 글을 10% 이상 섞어주었을 때 크게 완화되었습니다. 이는 인터넷에 AI 생성 콘텐츠가 범람할수록 인간이 직접 겪고 쓴 오리지널 데이터의 가치가 급상승함을 증명합니다.
4. 0 to 1(창작) vs 1 to 100(확장)과 매체의 차이
- 이미지 생성 AI: 미드저니(Midjourney) 등은 인간이 상상하기 힘든 기괴하고 파격적인 결과물(환각)을 내놓기 때문에, 콘셉트 디자인의 극초반 단계에서 영감을 얻는 ‘0 to 1’의 도구로 유용하게 쓰일 수 있습니다.
- 텍스트/산문 생성 AI: 텍스트에서는 기초 프롬프트만 주면 가장 진부한 클리셰만 배출하므로 ‘0 to 1’을 AI에 맡길 수 없으며, 인간이 직접 겪은 삶의 경험과 지식에 기반해 1을 만들어준 뒤 확장하고 다듬는(1 to 100) 용도로 써야 합니다.
5. AI 저작권 분쟁: 앤트로픽 판결과 보르헤스의 ‘피에르 메나르’
- 앤트로픽(Anthropic) 소송 판결: 윌리엄 앨섭 판사는 AI 훈련을 위해 책을 학습하는 행위 자체의 변형적 성격을 인정하면서도, 데이터를 확보한 ‘입구(획득 방식)’를 엄격히 구분했습니다.
- 중고 종이책을 정당하게 돈을 주고 구매한 뒤 책등을 잘라 스캔하고 종이를 폐기한 ‘파괴형 북스캔’은 보유 권수가 늘어난 것이 아니므로 ‘공정 이용(Fair Use)’으로 보았습니다.
- 반면, 해적판 사이트에서 약 700만 권에 달하는 불법 복제 서적(PDF/EPUB)을 통째로 내려받아 사내 도서관을 구축한 행위는 명백한 권리 침해이자 위법으로 지적했습니다.
- 보르헤스의 소설 비유: 소설 속 주인공 피에르 메나르는 세르반테스의 『돈키호테』를 원문 한 글자도 바꾸지 않고 똑같이 써냈지만, 300년 뒤의 역사와 경험을 거친 인간이 쓴 글이기에 세르반테스의 글보다 훨씬 풍부한 의미를 지닙니다. 반면, 아무런 세상을 살지 않고 경험도 없는 AI가 생성한 동일한 문장은 누구의 맥락도 담지 못한다는 철학적 질문을 남깁니다.
핵심 데이터 / 비교표
데이비드 고이어의 각본 집필 방식 비교
| 구분 | 기존 방식 | AI 협업 방식 (Human in the Lead) | |—|—|—| | 장편 영화 초고 작성 기간 | 8주 ~ 10주 소요 | 4주 ~ 5주로 단축 | | 독백 다듬기/압축 (4p → 2p) | 1시간 ~ 2시간 소요 | 약 5분 소요 (AI 6개 변형안 추출 후 조합) | | 작업 역할 분담 | 인간 혼자 작성 및 수정 | 인간이 맥락과 의도 제공 → AI가 변형안 제시 → 인간이 최종 선별 및 결합 |
앤트로픽 저작권 소송(Bartz v. Anthropic) 내 학습 데이터 획득 방식 판단
| 학습 데이터 획득 경로 | 취득 규모 및 방식 | 법적 판단 (윌리엄 앨섭 판사) | 판단 근거 | |—|—|—|—| | 합법 구매 중고책 | 정가 지불 구매 후 파괴형 북스캔(스캔 후 원본 종이 폐기) | 공정 이용 (Fair Use) 인정 | 형태만 종이에서 파일로 변환되었을 뿐, 실질적인 책 보유 수량(1권)이 증가하지 않음 | | 해적판 사이트 | 불법 복제된 서적 파일 통째 다운로드 | 침해 및 위법 행위로 판시 | 정당한 라이선스 비용 및 협상을 회피하고 무단으로 불법 사내 도서관을 구축함 (약 7백만 권 규모) |
타임스탬프별 핵심 포인트
| 시간 | 핵심 내용 |
|---|---|
| 00:00 | 하이라이트: AI 대본의 평균화, 모델 붕괴 메커니즘, 인간 맥락의 중요성 예고 |
| 00:40 | 플라톤의 ‘동굴의 비유’: 디지털 데이터는 현실의 왜곡된 그림자에 불과하다는 고이어의 주장 |
| 02:04 | 앤드류 응의 반론: AI 팀의 편향 제거 노력과 AI가 갖추지 못한 인간만의 ‘맥락’ |
| 05:23 | 고이어의 실제 AI 워크플로: 4페이지 독백을 2페이지로 압축하는 프롬프트 실험 |
| 06:22 | 헬리콥터 객실 탈출 액션 씬 브레인스토밍 및 각본 집필 기간 단축(8~10주 → 4~5주) |
| 07:33 | 플라톤 『국가』 동굴 이야기와 LLM의 다음 단어 예측(Next-token prediction) 구조 비교 |
| 09:34 | AI 편향 수정의 2단계: 사전학습 데이터 필터링과 사후 인간 채점(RLHF) |
| 10:52 | 《네이처》 모델 붕괴 실험: AI 데이터를 재학습한 AI가 산토끼 오류를 뱉어내는 과정 |
| 12:09 | 모델 붕괴의 해법(인간 글 10% 혼합)과 영화 <다크 시티="">의 '공동 기억 은행' 비유다크> |
| 15:07 | 관객 질문: AI는 0 to 1(창작)이 불가능하고 1 to 100(확장)에만 유효한 도구인가? |
| 15:50 | 고이어의 답변: 이미지 AI의 환각은 ‘0 to 1’ 영감이 되지만, 텍스트 산문은 인간 경험 필수 |
| 17:20 | 테드 심 질문 및 앤드류 응의 답변: 할리우드의 AI 공포와 미국·중국의 AI 국가 서사 비교 |
| 20:03 | 마이클 랜더 감독 질문: “AI는 남의 것을 훔친 것인가?”에 대한 예술가 고이어의 입장 |
| 21:37 | ‘Human in the Loop’를 넘어선 ‘Human in the Lead’: 창의성을 통째로 외주 주지 말 것 |
| 24:49 | 앤트로픽 저작권 판결: 파괴형 북스캔(공정이용)과 700만 권 해적판 다운로드(위법)의 경계 |
| 28:19 | 보르헤스 소설 『피에르 메나르, 돈키호테의 저자』를 통해 본 AI 문장과 인간 맥락의 본질 |
| 30:03 | 창작자에 대한 정당한 보상 및 공정성 문제 해결의 필요성과 대담 마무리 |
결론 및 시사점
- AI는 창의성의 대체재가 아닌 ‘벽치기 상대(Sounding Board)’: AI에게 창작의 전권을 넘기면 가장 진부한 결과물(AI 슬롭)만 나오지만, 인간이 명확한 맥락과 제약을 부여하고 수정·조합하는 주도권(‘Human in the Lead’)을 쥘 때 생산성과 효율성을 비약적으로 높일 수 있습니다.
- 오리지널 인간 경험의 가치 급상승: AI 생성 데이터의 무분별한 재학습은 AI 시스템 전체의 품질을 파괴하는 ‘모델 붕괴’를 초래합니다. 결국 고유한 삶의 맥락과 감각을 직접 겪고 작성한 인간의 글은 AI 시대에 가장 희소하고 가치 있는 원천 자원이 됩니다.
- 공정 이용의 명확한 법적 경계 확립 필요: 앤트로픽 소송 판례가 보여주듯, AI 학습 기술 자체는 변형적 공정 이용으로 보호받을 여지가 열려 있으나, 데이터 취득 과정에서의 불법적 편법(해적판 대량 다운로드 등)은 법적 철퇴를 맞게 됩니다. 창작자에 대한 투명한 보상과 건강한 경제 모델 구축이 AI 산업의 지속 가능성을 결정짓는 핵심 과제입니다.
추가 학습 키워드
- 모델 붕괴 (Model Collapse): 생성형 AI가 만든 합성 데이터를 다음 세대 모델의 훈련 데이터로 반복 사용할 때 데이터 다양성이 줄어들고 오류가 증폭되어 모델 성능이 회복 불가능하게 붕괴하는 현상.
- 플라톤의 동굴의 비유 (Allegory of the Cave): 플라톤의 『국가』에 등장하는 비유로, 감각과 데이터로 접하는 표상이 실제 본질(이데아)이 아닌 그림자에 불과함을 설명하며 AI 훈련 데이터의 왜곡 문제를 설명하는 은유로 사용됨.
- 파괴형 북스캔 (Destructive Book Scanning): 실물 종이책의 제본 부위를 절단해 낱장으로 만든 후 고속 스캔하고 원본 종이를 폐기하는 방식. 법원에서 1권의 합법적 복제 형태로 인정받아 공정 이용 판결의 근거가 됨.
- 공정 이용 (Fair Use): 저작권자의 허락 없이도 저작물을 비평, 연구, 교육, 변형적 창작 등의 목적으로 제한적으로 이용할 수 있도록 허용하는 미국 저작권법상의 법적 원칙.
- 피에르 메나르, 『돈키호테』의 저자 (Pierre Menard, Author of the Quixote): 호르헤 루이스 보르헤스의 단편 소설. 원문과 100% 동일한 글이라도 그것을 쓴 주체의 시대, 경험, 역사적 맥락에 따라 완전히 다른 예술적 가치를 지닌다는 점을 탐구한 사고실험.
기본 정보
| 항목 | 내용 | |—|—| | 채널 | 사이언스 아담 Science Adam | | 카테고리 | 과학기술 | | 게시일 | 2026-09-26 | | 영상 길이 | 30:31 | | 처리 엔진 | gemini-3.8-flash | | 원본 영상 | YouTube에서 보기 |