← 이북으로 보기

이슈페이퍼_챗GPT로 동영상까지 생성

발행: 한국과학창의재단 · 2024년 3월 26일

2024년 발행 당시의 자료이며 현재 상황과 다를 수 있습니다.

이북 원문에서 글자만 옮긴 전체 텍스트입니다. 표·그림·사진과 원래 모양은 이북에서 확인하세요.

1쪽

2024.3호

발행일 | 2024. 03. 26

Creativity

작성자 | 장미경 선임연구원 | 정책기획실 | 한국과학창의재단

편집

KOFAC

이슈 페이퍼

챗GPT로 동영상까지 생성한다, AI ‘소라’(Sora) 주목 산업계는 물론 교육계에도 혁신적 영향

Science

Issue

발행

Research

2쪽

챗GPT로 동영상까지 생성한다, AI ‘소라’(Sora) 주목 산업계는 물론 교육계에도 혁신적 영향

챗GPT 제작사인 오픈AI의 CTO(최고기술책임자) ‘미라 무라티’(Mira Murati)가 2024년 3월 13일, 월스트리트저널(WSJ)과의 인터뷰에서 “텍스트 프롬프트를 동영상으로 구현하는 프로그램인 ‘소라’(Sora) 모델을 2024년 이내 일반인들이 이용할 수 있을 것”이라고 밝혀 전 세계의 주목을 받고 있다. 구체적인 시기를 언급한 것은 아니지만, 월스트리트저널은 2024년 하반기에 소라가 공식 출시될 수 있을 것으로 전망했다.

미라 무라티(Mira Murati)는 누구? 월스트리트저널과 인터뷰를 진행한 미라 무라티는 ‘챗GPT의 어머니’로 불리는 인물이다. 무라티는 2018년 오픈AI에 합류한 후 ‘챗GPT’, ‘달리’(DALL-E) 등 생성형 인공지능 제품 출시를 주도한 것으로 잘 알려져 있다. 오픈AI 설립자이자 챗GPT의 아버지인 ‘샘 올트먼’(Sam Altman)과 마찬가지로 인공지능 위험성을 경고하면서 예방 노력을 기울여야 한다고 주장하는 인공지능 규제론자이다. 2023년 미국 타임지 등 각종 매체와의 인터뷰에서는 인공지능의 오남용과 악용 가능성, 안전을 위협하는 무분별한 경쟁 등에 대해 경고하면서, 인공지능 규제의 시급성을 강조했다. 2023년 11월 샘 올트먼 해임 사건 당시 오픈AI의 임시 CEO 직책을 맡은 바 있다.

오픈AI는 끊임없이 진행되는 놀라운 기술력과 이슈 파급력으로 글로벌 화두를 장악하고 있다. 2022년 11월 인간과 컴퓨터 간 텍스트 대화를 자연스럽게 주고받을 수 있는 모델 ‘챗GPT’(CHATGPT) 출시에 이어 텍스트 프롬프트를 이미지로 생성해 주는 ‘달리’(DALL- E)를 발표해 생성형 인공지능의 위력을 입증했고, 이러한 기술력을 더욱 확장한 동영상 생성 프로그램 배포를 위한 본격 행보에 나선 것이다.

시놉시스를 영상화할 수 있다는 개념에 따라 영화 제작 산업계는 물론, 과학 동영상 실험 제작 등 교육계에 미치는 영향도 상당할 것으로 예측된다. 전 세계에서 논의되고 있는 멀티모달 인공지능과 관련된 다양한 이슈를 좀 더 구체적으로 살펴보자.

장미경 선임연구원

3쪽

텍스트 명령어로 동영상 생성

오픈AI가 만든 소라 모델은 사용자가 텍스트 프롬프트(명령어)를 입력하면 이 내용에 부합한 동영상을 만들어 제공하는 인공지능 프로그램이다. 예를 들어, “중학교 과학실에서 화산 폭발 실험을 하는 학생들의 모습이다. 이탈리아 베수비오 화산 분화구를 생생하게 표현하고, 세부 과학적 원리는 중학교 3학년 과학 교과서에 있는 내용을 반영한다”라고 입력하면 이를 사실적인 동영상으로 재현해 제공할 수 있다.

오픈AI는 소라 모델에 대해 “언어에 대한 이해도가 뛰어나 프롬프트를 정확하게 해석할 수 있고, 생생한 감정까지 표현하는 매력적인 캐릭터를 동영상으로 구현할 수 있다”고 설명하면서, “다양한 캐릭터, 특정 유형의 동작, 피사체와 배경의 정확한 세부 정보 등 복잡한 장면이 포함된 최대 1분 분량의 동영상을 빠르게 제작할 수 있다”고 홈페이지를 통해 밝힌 바 있다.

소라 모델은 2024년 2월 처음 발표된 이후 시각 예술가, 디자이너, 영화 제작자 등 제한된 일부 창작자들에게만 액세스 권한이 부여되어 있고, 개발자들은 이들의 피드백을 받아 안전성 문제 등 프로그램 테스트를 진행하고 있다.

아울러 오픈AI는 복잡한 장면에 대한 물리학을 정확하게 시뮬레이션하기 어렵다는 한계가 있으므로, 소라 프로그램이 원인과 결과의 특정 사례를 제대로 이해하지 못할 수도 있다는 단점을 제시했다.

오픈AI가 밝힌 소라 프로그램의 단점 사례에 따르면, 소라는 어떤 사람이 쿠키를 한 입 베어 무는 장면을 재현할 수는 있지만, 나중에는 쿠키에 베어 먹은 자국이 없어지는 오류를 발생시킬 수 있다. 왼쪽과 오른쪽을 혼합하는 등 프롬프트의 공간적 세부 사항을 혼동할 수 있고, 시간이 지나면서 발생하는 변수에 대해서는 기계 스스로 이해한 내용을 명확하게 반영하기가 어려울 수 있기 때문이다.

오픈AI는 동영상의 사실적 재현을 위해 음향을 통합할 계획이며, 사용자가 원하는 방향으로 콘텐츠가 완성될 수 있도록 소라가 생성한 동영상 콘텐츠를 이용자가 편집할 수 있게 하는 방안도 고민 중이라고 덧붙였다. 사용자가 피드백을 제공하고 수정 사항을 요청해 변경함으로써 최종 결과물의 완성도를 더욱 높일 수 있게 한다는 것이다.

4쪽

*(Several giant wooly mammoths approach treading through a snowy meadow, their long wooly fur lightly blows in the wind as they walk, snow covered trees and dramatic snow capped mountains in the distance, mid afternoon light with wispy clouds and a sun high in the distance creates a warm glow, the low camera view is stunning capturing the large furry mammal with beautiful photography, depth of field.) https://openai.com/sora

결과물

5쪽

안전성 문제 등 레드팀 운영 집중

미라 무라티는 소라 기능 개발에 사용된 훈련 학습 데이터가 무엇인지를 묻는 질문에 대해서는 구체적으로 답하지 않았고, 유튜브, 인스타그램, 페이스북 데이터가 포함되었는지에 대해서도 명확하게 밝히지 않았다. 다만, 공개적으로 사용할 수 있는 비디오, 오픈AI와 파트너십을 맺고 있는 이미지․영상 제작업체인 셔터스톡(Shutterstock)의 라이선스 콘텐츠를 활용하고 있다고만 답변했다.

또한 일반인을 대상으로 한 출시 및 배포 시점을 미루는 이유에 대해서는 ‘안전성’ 문제를 지목했다. 특히 미국 대선을 비롯해 전 세계적으로 선거가 진행되는 2024년, 생성형 AI를 악용한 가짜뉴스 확산 우려가 제기되고 있다는 점에 대한 심각성을 언급했다.

이와 관련하여 오픈AI는 현재 소라에 대한 취약성, 편향, 폭력성 등을 세밀하게 테스트하는 레드팀 운영에 집중하고 있다. 구체적으로, 잘못된 정보, 증오 콘텐츠, 편견 등 관련 분야의 전문가들과 협력하여 적대적 테스트를 진행할 예정이며, 오해의 소지가 있는 콘텐츠를 감지할 수 있는 도구를 구축하고 있다.

이 외, 달리 등에 적용된 기존의 안전성 도구를 소라에도 반영할 방침이다. 예를 들어, 오픈AI 제품을 사용할 때, 극단적 폭력, 성적 콘텐츠, 혐오 이미지, 유명인의 초상 또는 타인의 IP 요청 등 사용 정책을 위반하는 프롬프트는 텍스트 분류기가 확인하고 거부하게 된다. 오픈AI는 결과물을 사용자에게 제공하기 전, 생성된 동영상의 프레임을 검토해 사용 정책을 준수하는지 확인하는 이미지 분류기를 개발했으며, 전 세계의 정책 입안자, 교육자, 예술가를 참여시켜 향후 발생할 수 있는 우려 사항을 이해하고 기술의 긍정적인 사용 사례를 공유할 것이라고 밝혔다.

6쪽

프롬프트 빅서(Big Sur)의 가라이 포인트 해변을 따라 험준한 절벽에 부딪혀 부서지는 파도를 드론으로 촬영한 모습이다. 지는 태양의 황금빛이 바위 해안을 비추는 동안, 부서지는 푸른 바닷물은 하얀 파도를 만든다. 저 멀리 등대가 있는 작은 섬이 있고, 절벽 가장자리에 녹색 관목이 뒤덮여 있다. 도로에서 해변으로 내려가는 가파른 절벽은 가장자리가 바다 위로 튀어나와 극적 묘미를 선사한다. 해안의 원시적인 아름다움과 태평양 해안 고속도로의 험준한 풍경을 포착한 모습이다.

*(Drone view of waves crashing against the rugged cliffs along Big Sur’s garay point beach. The crashing blue waters create white-tipped waves, while the golden light of the setting sun illuminates the rocky shore. A small island with a lighthouse sits in the distance, and green shrubbery covers the cliff’s edge. The steep drop from the road down to the beach is a dramatic feat, with the cliff’s edges jutting out over the sea. This is a view that captures the raw beauty of the coast and the rugged landscape of the Pacific Coast Highway.) https://openai.com/sora

결과물

7쪽

컴퓨팅 비용 최적화 및 제한 정책 적용

소라 프로그램을 구동하는 데는 이미지 생성 인공지능 프로그램인 ‘달리’(DALL-E) 등 다른 인공지능 도구보다 훨씬 더 많은 컴퓨팅 비용이 소요된다. 이에 대해 오픈AI는 일반인에게 공개하기 전, 최적화를 통하여 비용을 줄여 달리 수준으로 만들기 위해 노력하겠다는 계획이다.

미라 무라티는 오픈AI가 달리에 적용했던 제한 정책과 유사한 내용을 소라 모델에 적용할 가능성이 크다고 밝혔다. 앞서 언급했듯이 공인의 모습이 담긴 딥페이크(deepfake) 동영상, 정치적으로 민감하게 사용될 수 있는 동영상, 과다한 성적 노출이 담긴 동영상 등의 제작을 시도하는 텍스트 프롬프트는 실행 거부 대상이 된다. 이 외 정치적 악용 등을 막기 위해 소라가 생성한 비디오 클립 하단에 워터마크가 추가되고, 출처를 표시하는 메타데이터도 포함된다.

8쪽

AI와 산업계의 긴밀한 협력 의지

텍스트 프롬프트 와 동영상 결과물 예제

(출처 : 오픈AI 홈페이지)

기술 부분과 관련해서는, 20초짜리 720p 클립을 생성하는 데 단 몇 분이 소요된다고 설명했으며, 소라 프로그램의 등장으로 할리우드 업계가 영향을 받을 것이라는 전망에 대해서는 영화 산업계와 긴밀하게 협조할 의지를 피력했다. 즉 사용자의 창의성을 방해하지 않으면서 적절한 가이드라인을 유지하기 위해 일부 예술가 집단과 협력하고 있다면서, 영화 작업자들에게 테스트를 위한 조기 액세스를 제공했다고 설명했다. 아울러 소라 등 오픈AI의 프로그램이 전 세계 영화 산업 종사자와 창작자들에게 도움이 될 수 있도록 조언을 요청한다고 덧붙였다.

프롬프트 한 스타일리시한 여성이 따스하게 빛나는 네온과 애니메이션으로 만들어진 도시 간판으로 가득한 도쿄의 거리를 걷고 있다. 그녀는 검은 가죽 재킷, 긴 빨간 드레스, 검은색 부츠를 신고 검정 지갑을 들고 있다. 그녀는 선글라스와 빨간 립스틱을 발랐다. 그녀는 자신감이 넘치고 자연스럽게 걷는다. 거리는 축축하고 반사되어 다채로운 조명의 거울 효과를 만들어 낸다. 많은 행인들이 걸어 다닌다.

*(A stylish woman walks down a Tokyo street filled with warm glowing neon and animated city signage. She wears a black leather jacket, a long red dress, and black boots, and carries a black purse. She wears sunglasses and red lipstick. She walks confidently and casually. The street is damp and reflective, creating a mirror effect of the colorful lights. Many pedestrians walk about..) https://openai.com/sora

결과물

9쪽

*(Animated scene features a close-up of a short fluffy monster kneeling beside a melting red candle. The art style is 3D and realistic, with a focus on lighting and texture. The mood of the painting is one of wonder and curiosity, as the monster gazes at the flame with wide eyes and open mouth. Its pose and expression convey a sense of innocence and playfulness, as if it is exploring the world around it for the first time. The use of warm colors and dramatic lighting further enhances the cozy atmosphere of the image.) https://openai.com/sora

결과물

10쪽

구글, 동영상 생성 AI ‘루미에르’ 공개

한편, 구글은 소라 모델 출시보다 앞선 2024년 1월, 동영상 제작과 복원 기능을 수행할 수 있는 생성형 인공지능 모델 ‘루미에르’(Lumiere)의 출시를 예고한 바 있다. 출시 시기는 미정이지만, 개념과 결과물에 대한 논문은 깃허브에 공개된 상태다.

루미에르 모델은 ‘비디오 생성용 시공간 확산 모델’(Space-Time Diffusion Model for Video Generation)과 ‘시공간 U-넷’(Space-Time U-Net) 기술을 기반으로 한다.

기존 생성형 인공지능의 동영상은 영상 시작과 끝의 프레임을 미리 설정한 후 중간 부분을 삽입하여 완성하는 방식에 기반해 구현되는 반면, 루미에르는 이미지 원본의 질을 단계적으로 낮춘 후 다시 원본에 가깝게 복원하는 과정을 학습시킨 생성형 인공지능 프로그램이다.

좀 더 구체적으로 살펴보면, 루미에르는 원본 이미지를 점차 흐리게 만들면서 원본 이미지 형태를 잃게 한 후, 역으로 원본 이미지의 흐려진 부분을 제거하면서 실제 이미지를 찾아가는 방식으로 학습하고, 이러한 내용이 이미지 영상 제작과 복원 기술 구현에 활용된다. 사전 훈련된 데이터 모델을 반영함으로써 동영상 속 캐릭터 위치와 움직임을 자연스럽게 구현하는 것이다.

스테이블 디퓨전(Stable Diffusion), 달리((DALL-E), 미드저니(Midjourney) 등이 확산 모델을 활용하여 정지 이미지를 생성하는 프로그램인데, 루미에르는 확산 모델 기술을 동영상으로 확장한 형태라고 할 수 있다.

구글에 따르면 루미에르는 ① 사진과 프롬프트(명령어) 입력 시 동영상 제작 ② 동영상 스타일 변경 ③ 사진 일부의 동영상 변환 ④ 일부가 잘리거나 가려진 동영상 복원 등 다양한 기능을 수행할 수 있다.

구글 관계자는 루미에르를 통해 초보자도 창의적인 동영상 콘텐츠를 유연하게 생성할 수 있다고 강조하면서, 다만 허위 콘텐츠나 유해 콘텐츠 등 기술의 오용을 막는 도구가 필요하다는 점을 함께 언급했다.

11쪽

구글에서 루미에르 홈페이지에 공개한 텍스트-비디오 생성 장면 https://lumiere-video.github.io/

결과물

12쪽

메타의 생성형 동영상 모델, ‘에뮤 비디오’(Emu Video)

텍스트 프롬프트 와 동영상 결과물 예제

(출처 : 메타 홈페이지)

메타의 경우, 2023년 11월 텍스트 프롬프트를 통해 이미지와 동영상을 생성하는 인공지능 모델 ‘에뮤 비디오’(Emu Video)를 공개했다. 메타 관계자는 에뮤 비디오의 출시 일정이 아직 정해지지 않았지만, 출시가 확정되면 인스타그램과 페이스북에 탑재하여 SNS 사용자 수억 명에게 배포할 계획이라고 밝혔다.

에뮤 비디오는 ‘에뮤 에디트’(Emu Edit)라는 편집 프로그램을 활용하여 텍스트 입력, 참조 이미지 입력, 또는 둘을 병행하는 형태로 사용할 수 있으며, 이를 통해 4초 분량의 애니메이션 비디오를 생성한다. 예를 들어 텍스트 프롬프트에 따라 이미지를 생성한 후 다른 이미지를 합산하여 비디오를 만들 수 있다. 이러한 분할 접근 방식을 통해 비디오 생성 프로그램에 대한 효율적인 훈련이 가능하다.

메타 관계자에 따르면, 2개의 확산 모델을 사용해 비디오를 생성하기 때문에 5개 모델이 활용되었던 메타의 기존 비디오 생성 도구 ‘메이커 비디오’(Make-A-Video)보다 더 간단하게 구현할 수 있다.

프롬프트 기니피그 화가가 캔버스, 안트로, 매우 귀여운 어린이 영화 캐릭터, 컨셉 아트워크, 3D 컨셉, 디테일한 털, 영화를 위한 매우 세밀하고 상징적인 캐릭터에 그림을 그리고 있다.

*(A guineapig painter is painting on the canvas, anthro, very cute kid's film character, concept artwork, 3d concept, detailed fur, high detail iconic character for upcoming film.) https://emu-video.metademolab.com/

결과물

13쪽

텍스트 프롬프트 와 동영상 결과물 예제

(출처 : 메타 홈페이지)

*(Wildfire raging through a deep green forest, 4k, high resolution) https://emu-video.metademolab.com/

프롬프트 폭포 가장자리 강에서 물고기를 사냥하는 회색곰, 사실적으로.

*(A grizzly bear hunting for fish in a river at the edge of a waterfall, photorealistic.) https://emu-video.metademolab.com/

결과물

14쪽

*(There's a dog with a harness on that is running through an open field and flying a kite.) https://emu-video.metademolab.com/

글이 없거나 같은 내용이 반복되는 쪽은 뺐습니다. 이북으로 보기