https://youtu.be/tWgjhC7dJRo?si=Fm1eHLyP2RtdWPVn
Google DeepMind Lead Researchers on Genie 3 & the Future of World-Building
Genie 3 can generate fully interactive, persistent worlds from just text, in real time.In this episode, Google DeepMind’s Jack Parker-Holder (Research Scient...
www.youtube.com
- - 모든 애플리케이션은 기본적으로 몇 마디 말만으로 세상을 생성하는 능력에서 비롯됩니다. 당신이 세상을 바라보면, 눈앞에 세상이 펼쳐지는 것을 볼 수 있습니다. 그것이 현실이 되고 있다는 점이 놀랍습니다. 저는 우리가 이 능력을 어디까지 밀어붙일 수 있을지 매우 기대했습니다. 비전문가인 사람도 그것을 보고 진짜처럼 느껴질 정도의 수준에 도달했습니다. 저는 그것이 정말 대단하다고 생각합니다. 잭 슐로미 님, GD3가 인터넷을 장악했습니다. 오늘 팟캐스트에 모시게 되어 영광입니다. 반응이 놀라웠나요? 반응에 대해 잠시 생각해 주세요.
- - 우리는 이것이 얼마나 크게 될지 확신하지 못했지만, 저는 분명히 오랫동안 기다려온 무언가를 얻었다고 느꼈습니다. 실시간으로 환경을 생성할 수 있다는 것이죠. 구글 딥마인드 내부와 외부에서 이루어진 많은 작업들이 그 방향을 가리키고 있었다고 생각합니다. 우리는 그것을 실제로 구현하고 싶었고, 그렇게 해냈기를 바랍니다. 마크 님, G3에서 무엇이 그렇게 혁신적이었고 왜 이 대화를 나누는 것에 대해 그렇게 흥분하는지 내부적으로 잠시 생각해 볼까요?
- - 마크: 네, 물론입니다. 우선 정말 놀라운 모델입니다. 특수 메모리, 모든 프레임에 걸친 일관성에 대해 많은 기대가 있다고 생각합니다. 동영상으로 이러한 종류의 상호작용적인 방식을 사용할 수 있는 것은 이번이 처음인 것 같습니다. 이전에는 하나의 프롬프트를 사용하여 15초짜리 동영상을 만들었지만, 이제는 어떤 종류의 상호작용적 요소를 가질 수 있게 되어 매우 흥미롭다고 생각합니다. 이 부분에 대한 당신의 통찰력을 좀 더 자세히 설명해 주시겠어요? 예를 들어, 어떤 데이터를 수집해야 하는지 파악하고, 그것을 매우 상호작용적으로 만들고, 전체 동영상의 흐름을 유지하는 방법은 어떠했는지요? 그것은 경이로웠다고 생각합니다.
- - 슐로미: 네, 그렇습니다. 당신이 몇 가지 기능을 강조했습니다. 생성 길이, 세상의 일관성, 그리고 생성할 수 있는 것들의 다양성까지요. 작년에 우리는 여러 다른 분야에서, 즉 개별적인 노력들로 상당한 진전을 이루었다고 생각합니다.
- - G2 프로젝트는 훨씬 더 3D 환경을 생성할 수 있었지만, 품질이 그리 높지 않았습니다. 지니 1에서 나온 것 같았지만, 당시 최첨단 비디오 모델이었던 V2와는 같은 품질이 아니었습니다. V2는 지니 2가 출시된 지 일주일 뒤인 12월경에 거의 동시에 출시되었습니다. 내부적으로는 두 프로젝트 사이에 우리가 추구하는 다른 방향에 대한 많은 논의가 있었습니다. 또한, 게임 및 생성 작업도 있었습니다. 사람들이 둠 페이퍼로 알고 있는 것이죠. 당신들도 그것이 나온 직후에 좋은 글을 썼다고 생각합니다. 그래서 이러한 다른 프로젝트들 전반에 걸쳐 우리가 자연스럽게 결합할 수 있는 흥미로운 것들이 많이 있다고 느꼈습니다. 기본적으로 결합된 프로젝트의 가장 야심 찬 버전을 가져와서 그것이 가능한지 확인하려고 했습니다. 다행히도 가능했습니다. 그리고 타임라인이 아마도 우리 중 많은 사람들을 놀라게 한 부분일 것입니다. 우리는 분명히 목표를 설정하고 그것을 달성하기 위해 매우 열심히 노력했지만, 실제로 그 시점에 도달했을 때 어떻게 느껴질지는 절대 확신할 수 없었습니다. 저는 그것이 우리가 예상했던 것보다 훨씬 더 많은 사람들에게 반향을 일으켰다고 생각합니다. 그러나 우리는 항상 신뢰했습니다.
- - 실시간 구성 요소는 정말 중요하다고 덧붙이고 싶습니다. 많은 사람들이 직접 경험하지는 못했지만, 우리는 출시 시 적어도 몇몇 신뢰할 수 있는 테스터들이 모델과 상호작용하도록 하고, 사람들이 키보드를 사용하여 모델을 제어하는 방법을 보여주는 오버레이를 추가하여 그 느낌을 얻도록 노력했습니다. 실시간 측면에는 마법 같은 무언가가 있다고 생각합니다. 우리 모델, 즉 게임 엔진 모델이 충분히 빠르게 작동하기 시작했을 때 저는 처음으로 그것을 느꼈습니다. 우리는 마치 "세상에, 정말 내가 걸어 다닐 수 있잖아!"라고 외쳤습니다. 그것은 경외심을 불러일으키는 순간이었습니다. 즉시 반응할 때 마법 같은 무언가가 있다고 생각합니다. 둠 시뮬레이션이 나왔을 때 많은 사람들의 상상력을 자극했다고 생각합니다.
- - 여기서는 우리는 그것이 작동할지 확신할 수 없는 곳으로 밀어붙이고 싶었습니다. 그래서 그것은 분명히 가능한 것의 경계에 있었습니다. 우리는 그렇게 느꼈습니다. 그래서 우리는 "네, 한번 시도해 보고 그것을 실현할 수 있는지 봅시다"라고 말했습니다. 당신들은 아마 의도했든 아니든 완벽한 시기에 그것을 공개했습니다. X와 레딧 등 모든 곳에서 사람들이 게임 속을 걸어 다니는 캐릭터 동영상을 만들고 있었지만, 그것들은 분명히 상호작용적이거나 실시간이 아니었습니다. 그리고 당신들이 이 실제 제품과 같은 것을 출시했고, 사람들을 깜짝 놀라게 했습니다.
- - 이 모델에 대한 수많은 애플리케이션을 상상할 수 있기 때문에 궁금합니다. 예를 들어, 더 제어 가능한 비디오 생성, 게임 제작을 훨씬 쉽게 만드는 것, 심지어 누군가가 자신의 세계를 만들고 그 안을 걸어 다니는 개인 게임, 에이전트를 위한 RL 환경, 로봇 공학 등. 당신이 가장 기대하는 특정 사용 사례가 있나요?
- - 저는 모든 애플리케이션이 기본적으로 몇 마디 말만으로 세상을 생성하는 능력에서 비롯된다고 생각합니다. 비디오 모델을 처음 보기 시작했을 때, 저는 구글 리서치 모델이었던 이매진 비디오를 생각했습니다. 당시에는 오늘날 우리가 가진 모델에 비하면 매우 기본적인 모델들이 많았지만, 무언가를 시뮬레이션할 수 있는 능력, 즉 그것을 보고 눈앞에 세상이 펼쳐지는 것을 볼 수 있다는 점이 놀랍습니다. 그리고 이 시점에서 저는 그것을 어디까지 밀어붙일 수 있을지 매우 기대했습니다. 그래서 VIA는 한 가지 방법이었고, 지니는 그것을 좀 더 상호작용적으로 만드는 또 다른 방법입니다.
- - 저는 모든 애플리케이션이 기본적으로 이 핵심 기능에서 비롯된다고 생각합니다. 물론 당신이 말했듯이 엔터테인먼트가 될 수도 있고, 에이전트 훈련이 될 수도 있고, 에이전트가 세상을 추론하는 데 도움이 될 수도 있고, 교육이 될 수도 있습니다. 그래서 저는 어떤 특정 애플리케이션이 다른 애플리케이션보다 더 중요하다고 생각하지 않습니다. 그것은 전적으로 미래의 개발자들이 그 위에 어떻게 구축할지에 달려 있다고 생각합니다.
- - 마크: 네, 저는 기본적으로 같은 대답을 할 것입니다. 단지 다른 여정을 통해 거기에 도달했을 뿐입니다. 저는 GE 프로젝트를 2022년에 시작하기 전에 몇 년 동안 강화 학습 분야에서 일했습니다. 원래 동기는 당시 RL에 이런 문제가 있었는데, 어떤 환경을 해결해야 할까 하는 것이었습니다. 사람들은 수년 또는 수십 년이 걸릴 것이라고 생각했던 바둑을 이미 해결했기 때문입니다. 바둑은 2016년에 해결되었고, 우리는 2016년에 초인간적인 수준에 도달했습니다. 그리고 스타크래프트는 3년 뒤에 해결되었습니다. 2021년경에는 점진적으로 중요한 무언가에 비해 그리 긴 시간이 아닙니다. RL로 무엇을 해야 할지에 대한 큰 질문이었습니다. 우리는 알고리즘이 올바른 환경을 가지고 있다면 초인간적인 능력을 배울 수 있다는 것을 알지만, 환경이 무엇이 될지는 알지 못합니다. 그래서 우리는 코드로 우리만의 환경을 설계하는 작업을 하고 있었습니다. 그러나 첫 텍스트-이미지 모델이 나왔을 때, 장기적으로 무한한 환경을 진정으로 해제하는 방법은 무엇일까 하는 것이 더 유망한 길처럼 보였습니다.
- - 그렇기는 하지만, 프로젝트를 진행하면서, 그리고 원래 2022년에 시작했을 때는 그 한 가지 애플리케이션에 매우 집중했습니다. 그러나 이제는 이것이 당신이 언급한 다른 모든 영역에 큰 영향을 미칠 수 있다는 것이 꽤 분명합니다. 그래서 2021년의 언어 모델처럼, 몇 년 뒤에 IMO 금메달이 그렇게 빨리 나올 것이라고는 아마 상상하지 못했을 것입니다. 그러나 그 기술의 직접적인 애플리케이션으로서 그것은 아마도 이메일에 도움이 될 것이라고 생각했습니다. 이러한 새로운 종류의 기반 모델을 구축하고 사람들이 그것으로 무엇을 할 수 있을지 상상하는 것을 보는 것은 정말 멋진 일이라고 생각합니다. 연구 미리 보기를 공유하는 것의 정말 흥미로운 점 중 하나는 우리가 이런 종류의 피드백을 받았다는 것입니다. 그래서 우리는 이러한 많은 일들이 일어날 수 있기를 바랍니다.
- - 잭, 연구 미리 보기 게시물에서 저를 놀라게 한 것 중 하나는 이것이었습니다. 블로그 게시물에서 첫 번째 GIF도 아니었습니다. 두 번째나 세 번째였는데, 누군가가 붓으로 벽을 칠하고 캐릭터가 움직이는 시각 자료가 있었습니다.
- - 마크: 네, 특수 메모리죠. 벽의 다른 부분으로 가서 칠하고 다시 돌아오면 원래의 페인트가 그대로 있습니다. 저는 믿을 수 없었습니다. "그럴 리가 없어"라고 생각했습니다. 그리고 나서 읽어보니 당신 말이 맞았습니다. 그것은 특수 메모리로 묘사되어 있었습니다.
- - 저에게는 지속성 부분이 중요했습니다. 다른 모든 것들, 상호작용성도 물론 놀랍습니다만, 저는 광범위하게 말해서 사람들은 언젠가 비디오 생성 등이 실시간이 될 것이라고 예상했다고 생각합니다. 지니 3 게시물을 보았을 때 저는 "좋아, 그들이 정말 해냈군"이라고 생각했습니다. 그러나 특수 메모리, 즉 지속성은 제가 의자에 앉아 "어떻게 이런 일이 일어났지?"라고 생각하게 만든 부분이었습니다.
- - 특수 메모리가 갑자기 나타난 속성으로 발견되었는지, 아니면 특정 설계 목표였는지에 대해 좀 더 이야기해 줄 수 있을까요? 그 비하인드 스토리가 궁금합니다. 그것이 큰 돌파구처럼 느껴지기 때문입니다.
- - 잭: 네, 좋은 질문입니다. 몇 가지 말씀드리겠습니다. 간단히 말해서 그것은 완전히 계획된 것이었지만, 그렇게 잘 작동했을 때 여전히 엄청나게 놀라웠습니다. 제가 그 특정 샘플을 보았을 때 믿기 어려웠습니다. 모델이 생성하는 것인지 잠시 동안 확신할 수 없었습니다. 몇 번을 다시 보고, 프레임을 멈춰서 다시 확인해야 했습니다.
- - 몇 단계 뒤로 돌아가서, 지니 2는 분명히 어떤 종류의 메모리를 가지고 있었습니다. 이것은 지니 2가 많은 흥미로운 발표와 함께 나왔을 때 약간 잊혀졌습니다. V2는 불과 며칠 뒤에 나왔습니다. 그 해는 바쁜 시기였고, 주요 헤드라인은 우리가 새로운 세상을 전혀 생성할 수 있다는 것이었습니다. 그것이 우리가 강조하고 싶었던 것이었습니다. 그러나 그것은 몇 초간의 메모리를 가지고 있었고, 제가 로봇을 피라미드 근처에 만들고 나서 시선을 돌렸다가 다시 보았을 때 피라미드가 여전히 그 자리에 있었지만 약간 흐릿했습니다. 완벽하지는 않았습니다. 그러나 비슷한 시기에 또는 최근에 나온 다른 모델들은 이 기능이 없었습니다. 그래서 사람들은 지니 2 작업에서 초기 징후를 알아차리지 못했기 때문에 그 부분에 주목했습니다.
- - 그리고 지니 3의 경우, 우리는 기본적으로 훨씬 더 야심 차게 같은 접근 방식을 사용했습니다. 우리는 메모리를 현재와 같이 만드는 것을 주요 목표로 삼았습니다. 우리는 1분 이상의 메모리, 실시간, 그리고 더 높은 해상도를 모두 같은 모델에 담고 싶다고 말했습니다. 그리고 이러한 목표들은 서로 상충됩니다. 그래서 우리는 이러한 기술적인 도전을 스스로에게 제시했고, 우리가 이것을 목표로 한다면 그것은 그저 실현 가능하고 꽤 놀라울 것이라고 말했습니다.
- - 그러나 분명히 그것이 어떻게 될지는 여전히 알 수 없습니다. 그래서 7개월 뒤 연구가 끝났을 때 샘플을 보면 여전히 매우 놀랍습니다. 그래서 네, 어느 정도 계획된 것이었지만, 볼 때 여전히 정말 멋지고 흥미롭습니다. 결국 연구 프로젝트는 확실한 것이 아니니까요. 우리가 하고 싶지 않았던 한 가지는 명시적인 표현을 구축하는 것이었습니다. 분명히 일관성을 달성할 수 있는 방법들이 있고, 그들은 명시적인 3D 표현을 통해 그렇게 했습니다. 즉, 너프, 가우시안 스플래팅 및 기타 방법들은 기본적으로 우리가 세상이 어떻게 생겼는지 안다면, 세상이 거의 정적으로 유지된다는 이러한 사전 가정을 사용하여 표현을 구축할 수 있다고 말합니다.
- - 그것은 일부 애플리케이션에는 훌륭하다고 생각하지만, 우리는 이 길을 가고 싶지 않았습니다. 그것이 다소 제한적이라고 느꼈기 때문입니다. 그래서 우리는 모델이 그렇게 하지 않는다고 분명히 말할 수 있습니다. 모델은 프레임별로 생성하며, 우리는 이것이 일반화가 실제로 작동하는 데 정말 중요하다고 생각합니다. 누군가가 처음으로 모델과 상호작용하고, 테스트하고, 시선을 돌렸다가 다시 돌아볼 때마다 저는 항상 숨을 참고 있다가, 다시 돌아와서 같은 것을 보면 "와, 여전히 정말 멋지다"라고 생각합니다.
- - 이 특수 메모리는 얼마나 지속되나요? 당신은 1분 이상이라고 언급했지만, 어떤 종류의 측정 기준이 있나요? 30분 동안 유지할 수 있나요? 한계는 무엇인가요? 근본적인 한계는 없지만, 현재 설계상 우리는 이 유형의 메모리를 1분으로 제한하고 있습니다. 네, 이것은 또한 게스트를 위한 실시간 절충안이기도 합니다. 우리는 폭과 다른 기능들 때문에 이 버전에서는 1분이 충분하다고 느꼈습니다. 이것은 꽤 상당한 도약이지만, 분명히 결국에는 더 많은 것을 원할 것입니다.
- - 지니 1에서 2로, 그리고 2에서 3으로 가는 것에 대한 한 가지 더 질문이 있습니다. 예를 들어, NLM과 같은 모델에서는 딥카 1처럼 모델을 더 오래 실행할수록 갑자기 흥미로운 행동을 보게 됩니다. 모델이 추론을 시작하거나 "내가 틀렸다, 스스로 수정해야겠다"와 같은 반응을 보입니다. 당신들은 2에서 3으로 확장하는 과정에서 데이터 양과 컴퓨팅 양을 늘림으로써 예상치 못하게 갑자기 나타난 흥미로운 행동을 보았나요?
- - 잭: 네, 저는 전반적으로 많은 생성 모델에서 규모가 커질수록 개선이 이루어진다는 점은 비밀이 아니라고 생각합니다. 그리고 우리가 언어 모델이 가진 것과 같은 종류의 지능이라고 말할 수 있을지는 모르겠습니다. '추론'이 올바른 용어인지는 확실하지 않습니다. 그러나 우리는 분명히 다음과 같은 것들을 봅니다. 예를 들어, 문에 접근하면 에이전트가 문을 여는 것이 합리적이라고 추론하여 그렇게 하기 시작할 수 있습니다. 또는 시간이 지남에 따라 더 나은 단어 이해가 발생하고, 모든 것이 더 좋아지고 현실적으로 보입니다. 이러한 추세들을 관찰했습니다.
- - 슐로미: 네, 지니 2에서 3으로 가면서 실제 세계 기능이 정말 많이 향상되었다고 생각합니다. 물리적인 측면에서, 물 시뮬레이션 중 일부, 그리고 조명 또한 정말 숨 막힐 정도입니다. 블로그에 폭풍우 예시가 있는데, 그 예시가 정말 멋지다고 생각합니다. 비전문가인 사람도 그것을 보면 진짜라고 생각할 정도입니다. 그것이 정말 대단하다고 생각합니다. 반면에 지니 2는 대략적으로 무엇을 해야 하는지는 이해했지만, 진짜 같지는 않았습니다. 그것을 보면 분명히 완전히 포토리얼리스틱하지 않다는 것을 알 수 있었습니다. 그래서 저는 품질 면에서 상당한 도약이 있었다고 생각합니다.
- - 마크: 네, 모든 예시에서 정말 멋진 것 중 하나는 물이 세상과 객체가 어떻게 상호작용하는지 이해하는지를 볼 수 있는 좋은 방법이었다는 것입니다. 누군가가 게시한 발이 물웅덩이에 들어가는 예시는 놀라웠습니다. 그러나 또한 만화 캐릭터가 애니메이션 스타일로 푸른 풀밭을 가로질러 달려가다가 파란색 물결 모양의 물체처럼 보이는 곳으로 달려가 수영을 시작하는 예시도 있었습니다. 그것이 정말 흥미로웠다고 생각합니다. 모델이 다른 환경과 다른 스타일에서 캐릭터가 어떻게 상호작용해야 하는지 이해할 수 있도록 특별히 해야 했던 일이 있었나요?
- - 잭: 당신이 기본적으로 설명하고 있는 것은 다양한 종류의 환경 지형과 세계, 그리고 물이나 모래 위를 걷는 것, 내리막길을 눈밭에서 내려가는 것과 같이 에이전트의 상호작용이 그들이 있는 지형에 따라 어떻게 달라져야 하는지에 대한 실제 폭넓은 범위입니다. 그리고 저는 그것이 정말로 규모와 훈련의 폭의 속성이라고 생각합니다. 이것은 매우 많은 부분에서 나타나는 현상이며, 우리가 이를 위해 특별히 하는 것은 없다고 생각합니다. 당신은 다시 말하지만, 모델이 일반적인 세계 지식을 가지고 있어야 하기 때문에 이것을 배웠기를 바랍니다. 항상 완벽하게 작동하는 것은 아니지만, 일반적으로는 꽤 좋습니다. 예를 들어, 스키 예시에서는 내리막길로 갈 때 빠르게 움직이고, 다시 오르막길로 돌아가려고 할 때는 매우 느리거나 아예 불가능합니다. 물에 들어가면 분명히 당신이 말했듯이 에이전트가 수영하고 물을 튀기기 시작하기를 바라는데, 이것은 일반적으로 일어납니다. 물웅덩이 근처를 내려다볼 때, 바라건대 웰링턴 부츠를 신고 있기를 바랍니다. 이런 종류의 것들은 그저 자연스럽게 말이 되며, 그것이 당신이 세상에 대해 생각했던 것과 매우 일치하고 모델이 그것을 모두 생성했기 때문에 정말 마법처럼 느껴진다고 생각합니다. 네, 그것 또한 정말 흥미로운 점 중 하나입니다.
- - 슐로미: 네, 게다가 우리가 일반적으로 겪는 절충안 중 하나는 모델이 두 가지를 하기를 원한다는 것입니다. 모델이 일관성 있게 보이도록 세상을 만들기를 원합니다. 잭이 말했듯이 비나 웅덩이에서 걸을 때는 아마 부츠를 신을 것입니다. 그러나 우리가 다른 설명을 제공하거나 프롬프트가 다른 것을 말한다면, 우리는 모델이 여전히 프롬프트를 따르기를 원합니다. 그리고 여기에는 약간의 긴장감이 있습니다. 왜냐하면 어떤 것들은 매우 불가능할 수 있기 때문입니다. 당신은 "나는 플립플롭을 신고 비 속으로 뛰어들고 싶어"라고 말할 수도 있습니다. 그러면 모델은 여전히 매우 불가능한 것을 만들려고 노력해야 합니다. 그리고 이것이 일반적으로 비디오 모델들이 더 어렵다고 느끼는 부분이며, 우리 모델들도 더 어렵다고 느낄 수 있는 부분입니다. 그러나 그럼에도 불구하고, 이러한 낮은 확률의 영역으로 가는 데 놀라울 정도로 성공적입니다.
- - 저는 그것이 정말로 우리가 원하는 것이라고 생각합니다. 많은 사람들이 단순히 자신의 방처럼 보이는 비디오를 보고 싶어 하지 않을 수도 있습니다. 그러나 좀 더 흥미로운 것을 원합니다. 그리고 이것이 바로 모델의 마법이라고 생각합니다. 그들은 현실에서는 존재할 가능성이 높지 않은 장소로 당신을 데려갈 수 있습니다. 이 모델의 텍스트 따르기는 정말 놀랍습니다. 그리고 그것은 정말 마법처럼 느껴집니다. VO도 텍스트와 매우 잘 일치하여 요청하는 것을 매우 잘 수행한다고 생각합니다. 그리고 우리는 지니 3에서도 그것을 가지고 있습니다. 그래서 매우 구체적인 세상과 정말 임의적인 바보 같은 것들을 설명할 수 있고, 그것은 거의 작동합니다. 우리는 실제로 이 논의를 했습니다. 사람들이 제가 만든 제 강아지 동영상이 실제 제 강아지 사진이 아니라는 것을 알고 매우 실망했기 때문입니다. 저는 단지 텍스트로 강아지를 묘사했을 뿐입니다. 네, 그것이 큰 비밀인지는 모르겠지만, 강아지와 똑같이 보였습니다. 그리고 모델은 그냥 아는 것 같았습니다. 그리고 그것은 정말 놀랍다고 생각합니다.
- - 저는 그것이 실제로 지니 2에서는 없었던 정말 중요한 기능이라고 생각합니다. 우리는 이미지 프롬프트에 의존했기 때문에 일부 전송 문제가 있었습니다. 이미지를 생성하기 위해 이매진에 의존했는데, 그것은 종종 정말 좋아 보였지만, 세상을 시작하기에 반드시 좋은 이미지는 아니었습니다. 반면에 텍스트에서 직접 시작하면 거의 모든 것을 제어할 수 있습니다. 게다가 모델이 제 기능을 수행하기에 올바른 공간에 있기 때문에 자연스럽게 작동합니다. 그것은 정말 강력한 것입니다.
- - 잭, 왜 그렇게 엄청난 명령어 따르기 또는 텍스트 준수 이득이 있었을까요? 그것은 잘하기가 꽤 어려운 일인데요. 우리 팀은 이 분야에서 실제로 작업한 적이 없었습니다. 지니 1과 2 모두 이미지 프롬프트로 작업했습니다. 그래서 분명히 이 다음 단계에서는 우리는 다른 프로젝트에서 내부적으로 이루어진 많은 연구를 활용했습니다. 그리고 인력 면에서 슐로미 님은 VO 프로젝트를 공동으로 이끌었습니다. 그래서 우리는 내부의 다른 많은 작업과 아이디어를 기반으로 구축할 수 있었습니다. 그리고 그것은 기본적으로 우리가 발전을 가속화할 수 있도록 해주었습니다. 우리가 구글 딥마인드의 일원이 아니었다면, 우리가 독자적으로 점진적으로 구축했다면 훨씬 더 오랜 시간이 걸렸을 것이라고 생각합니다. 지금 이 회사에 있는 것이 정말 흥미로운 점은 우리가 다양한 분야에 많은 전문가를 보유하고 있어서 조언과 도움을 구할 수 있다는 것입니다.
- - 슐로미 님께 질문입니다. V3 작업을 이끄셨는데, 그것은 정말 놀라운 일입니다. 이것이 왜 지니 3이고 V3 실시간이 아닌가요? 저는 분명히 약간 다르다고 생각합니다. 지니는 환경을 탐색하고 작업을 수행할 수 있도록 합니다. 그리고 그것은 베일이 현재 할 수 없는 일입니다. 그러나 지니가 가지고 있지 않은 다른 측면들도 있습니다. 예를 들어, 지니는 일반적으로 오디오를 가지고 있지 않습니다. 그래서 우리는 잠재적인 유사점이 분명히 있지만, 기능과 우리가 이것을 어떻게 생각하는지 면에서 충분히 다르다고 생각합니다. 또한, 현재 지니 3는 제품으로 출시되지 않았습니다. 그리고 우리는 이것을 주류가 되고 매우 인기가 많아진 제품으로 생각합니다. 미래는 알 수 없지만, 현재로서는 기능과 우리가 이것을 어떻게 생각하는지 면에서 충분히 다르다고 생각했습니다.
- - 지니 3는 거의 연구 미리 보기입니다. 현재 출시하고 있는 것이 아닙니다. 우리가 많이 생각하는 것 중 하나는 모달리티의 경계가 어디인가 하는 것입니다. 우리는 실시간 이미지와 비디오, 그리고 실시간 비디오와 상호작용적 세계 생성, 세계 모델 사이의 경계가 매우 빠르게 흐려진다는 것에 대해 항상 이야기합니다. 지니 3가 무엇인지에 대한 좋은 단어는 아직 없다고 생각하지만, 당신들은 그것을 세계 모델이라고 불렀는데, 그것은 훌륭한 용어라고 생각합니다. 그러나 당신의 생각에는 비디오 생성 모달리티는 어디에서 멈추고 실시간 세계가 어디에서 시작하나요? 미래에는 이것들이 기본적으로 하나의 모달리티로 수렴할 것이라고 생각하나요? 아니면 앞으로 몇 년 동안은 이것들이 완전히 다른 분야로 분화될 것이라고 예측하나요? 오늘날 이것들은 비디오 생성이라는 공통된 부모를 공유하는 것 같습니다. 그러나 세상은 어디로 가고 있다고 생각하나요? 이것들이 완전히 다른 분야인가요?
- - 제 관점에서는 그것들은 다릅니다. 즉, 모달리티는 한 가지입니다. 우리는 텍스트, 오디오를 가지고 있습니다. 오디오 내에서도 다른 종류의 서브 모달리티가 있습니다. 스피치는 음악과 같지 않습니다. 우리는 음악 생성을 위한 다른 제품을 가지고 있고, 스피치 생성을 위한 다른 모델도 가지고 있습니다. 스피치 이해도 마찬가지입니다. 그래서 하나의 모달리티 내에서도 다른 맛을 가질 수 있습니다. 그리고 물론 비디오와 다른 것들도 있습니다. 그래서 저는 기본적으로 모달리티는 한 가지 차원이고, 또 다른 차원은 우리가 얼마나 빠르거나 얼마나 신속하게 새로운 샘플을 생성할 수 있는지라고 말하고 싶습니다. 그리고 완전히 직교하는 차원은 우리가 얼마나 많은 제어력을 가지고 있는지일 것입니다. 그래서 우리는 G3를 위해 공간에서 특정 방향 또는 특정 벡터를 선택했다고 생각합니다.
- - 다른 제품, 다른 모델들은 다른 방향으로 가려고 시도할 수 있다고 생각합니다. 공간은 꽤 크고 많은 절충안이 있습니다. 그래서 저는 잘 모르겠습니다. 사람들은 모든 것을 할 수 있는 하나의 모델이 있다고 믿는 사람들도 있지만, 저는 여전히 열려 있다고 생각합니다.
- - 우리가 엔지니어링이 연구의 큰 부분을 차지하는 곳에 있다는 것이 가장 좋은 방법은 무엇일까요? 실제로 이러한 것들을 만드는 것은 논문이 아닙니다. 우리는 사람들이 실제로 사용할 수 있는 무언가를 만들고 싶습니다. 그래서 저는 이것이 추상적인 아이디어를 특정 지점으로 가져가지만, 실제로 무언가를 구축하려면 구체적인 결정을 내려야 한다는 점이 정말 중요하다고 생각합니다. 그리고 그것은 당신이 무엇을 하고 싶은지, 무엇을 할 것인지를 결정하도록 강요한다고 생각합니다.
- - 마크: 네, 이것은 정말 흥미로운 점입니다. 궁극적으로 그것은 기술적 결정과 목표에 의해 주도되어야 합니다. 지금 모델들을 보면, 우리는 분명히 올해 V3와 G3를 별도의 프로젝트로 하기로 선택했습니다. 그리고 지금 두 모델을 보면, 다른 모델이 가지고 있지 않은 매우 다른 기능들을 가지고 있습니다. 그리고 기술적으로 그 모든 것을 이미 하나의 모델로 결합하는 것은 매우 어려울 것이라고 생각합니다. V3는 G3보다 분명히 더 높은 품질 기준을 가지고 있습니다. 그리고 그것은 매우 다른 우선순위를 가지고 있습니다. 그래서 자연스럽게 "음, 이 둘을 함께 가져와서 결합하면 어떨까?"라고 말할 수 있지만, 그것이 이 두 모델 모두에게 최선의 다음 단계가 아닐 수도 있습니다.
- - 다른 모델이 가지고 있는 것이 완전히 다른 경험에 가장 매력적인 것이 아닐 수도 있습니다. 그리고 두 모델 모두에 대한 관심의 폭을 고려할 때, 실제로 두 모델을 적극적으로 사용하는 사람들은 매우 적은 집단입니다. 그들은 당신들처럼 AI에 더 폭넓게 관심 있는 사람들인 경향이 있습니다. 하류 사용 사례라기보다는요. 그래서 당신이 언급했듯이 에이전트 훈련의 경우, 그것은 매우 높은 액션 빈도를 요구하고, 더 자기 중심적인 세계를 요구하며, 작업이 완료될 수 있는 세계를 요구하지만, 바이오 모델로 생성할 수 있는 고품질 시네마틱 스타일의 비디오를 요구하지는 않습니다. 그것은 꽤 다릅니다.
- - 영화 제작 요소에 관해서는, 저는 지니 3가 현재 그 정도 수준에 있다고 확신하지 못하고, 그것이 반드시 목표가 될 것이라고 생각하지도 않습니다. 영화 제작에 관해서는 지니 3가 오늘날 영화 제작 도구로 꽤 놀라운 일들을 할 수 있다고 생각합니다. 제가 지니 3에 접근할 수 있다면 놀라운 영화를 만들 것입니다.
- - 그러나 그것은 저의 질문 중 하나로 이어집니다. 당신들이 하는 작업은 정말 놀랍고, 모델을 훈련하고 팀을 관리하는 데 엄청나게 많은 생각과 노력이 필요할 것입니다. 모델을 훈련할 때 모델의 하위 사용 사례에 대해 얼마나 많이 생각해야 하나요? 당신들은 "우리는 사람들이 그것으로 무엇을 할지 아직 모르거나 신경 쓰지 않는다. 우리는 우리가 가야 할 연구 방향으로 가서 무슨 일이 일어나는지 볼 것이다"라고 생각하는 세상을 상상할 수 있습니다. 그러나 당신들이 이야기하는 방식에 따르면, 당신들은 다른 잠재적 사용 사례에 필요한 다양한 기능이나 특성에 대해 꽤 신중하게 생각한 것 같습니다. 적어도 다른 모델들의 경우에요.
- - 슐로미: 기본적으로 우리는 몇 가지 애플리케이션을 염두에 두고 있지만, 그것이 연구를 주도하는 것은 아니라고 말씀드리겠습니다. 그것은 이 특정 방향으로 얼마나 멀리 나아갈 수 있는지, 이 모든 것을 정말 훌륭한 품질로, 정말 빠르게 생성하고, 실시간으로, 매우 제어 가능하게 만들 수 있는지에 대한 것입니다. 그것이 G3를 개발하도록 우리를 이끈 것이라고 생각합니다. 그리고 애플리케이션은 따라옵니다. 솔직히 말해서, 저는 애플리케이션이 무엇이 될지 모릅니다.
- - 우리는 매우 놀랐습니다. G3의 경우 사람들이 어떻게 유용하게 사용하고 시각적인 것을 프롬프트하는 새로운 방법을 찾는지에 대해 언급하고 싶습니다. 사람들은 단지 그것을 발견할 뿐입니다. 우리는 처음에는 생각지도 못했습니다. 그래서 저는 미래에 더 많은 사람들이 접근할 수 있기를 기대합니다. 그리고 일반적으로 우리의 접근 방식은 시간이 지남에 따라 우리가 구축하는 모델에 대한 접근성을 높이는 것입니다.
- - 그리고 그것이 잠재력을 발견하는 유일한 방법이라고 생각합니다. 한 가지, 그와 관련된 질문은 지니 4, 5 또는 다른 모델들이 앞으로 어떻게 나아갈지에 대한 것입니다. 지금 가장 중요하게 생각하는 것은 무엇입니까? 예를 들어, 게임에 집중하고 싶다면, 두 개의 특수 메모리나 두 개의 완전히 다른 시점을 가진 멀티플레이어 유형의 게임을 할 수 있지만, 어느 시점에는 합쳐집니다. 앞으로 어떻게 나아갈지에 대해 어떻게 생각하고 있나요? 이 모델들을 더 많은 데이터와 더 많은 컴퓨팅으로 확장하는 것인가요? 아니면 여러 플레이어가 같은 모델을 보면서 다른 시점을 가지는 이러한 종류의 다중 우주를 만드는 것인가요? 당신들에게 가장 중요한 것은 무엇입니까?
- - 잭: 지금 가장 중요한 것은 며칠간의 휴가일 것입니다. 그 다음에는 현실 세계에서 제 강아지를 산책시키는 것이겠죠. 그리고 당신은 정말 흥미로운 많은 것들을 언급했습니다. 솔직히 말해서 우리는 현재 모델에 대한 피드백을 아직 많이 수집하고 있습니다. 그리고 일반적으로 우리는 가장 유능한 모델을 구축하는 데 가장 관심이 있습니다. 그래서 미래에는 더 넓은 영향력을 가질 수 있기를 바라며, 내부적으로나 외부적으로 다른 팀들이 멋진 일들을 할 수 있도록 실제로 지원할 수 있기를 바랍니다. 저에게는 제가 AGI에 대한 매우 집중된 비전을 가지고 이것을 시작했습니다. 그리고 저는 여전히 솔직히 AGI에 대해 제가 흥분하는 것, 즉 더 구현된 에이전트에 대해, 이것이 이러한 에이전트를 현실 세계로 데려가는 가장 빠른 길이라고 진정으로 믿습니다. 그리고 우리는 그 방향으로 큰 발걸음을 내디뎠다고 생각합니다.
- - 저는 때때로 다른 사람들이 모델을 보고 떠올리는, 제가 전혀 생각지도 못했던 애플리케이션에 더 흥분하기도 합니다. 그래서 이것은 일종의 절충안이라고 생각합니다. 분명히 일부 애플리케이션에 집중하고 싶지만, 다른 애플리케이션에도 열린 마음을 가지고 싶습니다. 그리고 이것이 이러한 종류의 모델을 구축하는 진정한 기쁨이라고 생각합니다. 저보다 훨씬 더 창의적인 모든 사람들을 볼 수 있기 때문입니다. 그래서 우리가 할 수 있는 정말 멋진 일들이 많이 있다고 생각하며, 솔직히 1년 뒤에 가장 큰 애플리케이션이 무엇이 될지는 정말로 말씀드릴 수 없습니다. 그러나 우리는 분명히 더 나은 모델을 구축하기 위해 노력할 것입니다.
- - 슐로미: 네, 저는 정말 기대되지만, 모델이 아무리 인상적이라고 해도 저는 우리가 세상을 정확하게 시뮬레이션하고 사람을 그 안에 넣고 원하는 대로 할 수 있는 것과는 아직 거리가 멀다고 생각합니다. 그리고 제가 '멀다'고 말할 때, 달력 시간상으로 멀다는 뜻은 아닙니다. 우리는 가속화된 시간대에 살고 있기 때문입니다. 그러나 거기에 도달하려면 더 많은 작업이 필요하다고 느껴집니다.
- - 그리고 저는 우리가 언젠가 어떤 형태로든 이 세상에 발을 들여놓고 무엇을 경험하고 싶은지 말할 수 있게 될 때를 상상합니다. 예를 들어, 무대 위에서 사람들과 이야기하거나 팟캐스트에서 이야기하는 것을 두려워하는 사람이 있다고 상상해 보세요. 그들은 그것을 시뮬레이션할 수 있습니다. 또는 거미를 두려워하는 사람이 있다고 가정하면, 그들은 스스로 그것을 극복하는 것을 실제로 볼 수 있습니다. 그것은 제 아내가 생각했던 예시 중 하나입니다. 제 아이디어가 아닙니다. 그래서 정말 많은 것들이 있다고 생각합니다.
- - 이 모든 것은 세상을 시뮬레이션하고 아마도 우리 자신을 그 안에 넣고, 아마도 우리 자신을 옆에서 보는 능력에 달려 있습니다. 그리고 잠재적으로 에이전트가 사물과 상호작용하게 하는 것입니다. 그리고 현실감과 그것이 우리 세상과 유사한 방식으로 작동하도록 만드는 것이 정말 중요하다고 생각합니다.
- - 잭: 저는 개인적으로 스키를 타는 것을 정말 무서워하는데, 모델들은 이미 그 점에서는 꽤 좋습니다. 그래서 일이 조용해지면 좀 시간을 보낼 수도 있겠습니다. 제가 아내에게 아이들이 스키 타는 법을 알면서 자랄 것이라고 약속했는데, 이제 약속을 지켜야 할 나이가 다가오고 있습니다. 아직 스키를 타고 싶지는 않아서요.
- - 슐로미: 잭 씨를 위해 모델을 개선해야겠습니다. 그래서 실제로 그 분포를 얻을 수 있도록요.
- - 잭: 그러길 바랍니다.
- - 슐로미: 팟캐스트를 시작하기 전에 로봇 공학에서 애플리케이션을 볼 수 있을 것이라고 이야기했습니다. 잭 씨는 구현된 AI에 대해 이야기했는데, 로봇 공학의 현재 한계는 데이터입니다. 얼마나 많은 데이터를 수집할 수 있는지 말이죠. 이제는 순전히 비디오를 녹화하는 것만으로는 이전에 할 수 없었던 많은 다른 장면들을 생성할 수 있을 것입니다. 그래서 그것은 또 다른 흥미로운 점입니다. 모델이 정말 놀랍습니다. 축하드립니다.
- - 로봇 공학 애플리케이션에 관해서는 어제 데미스 님이 지니 3에 대한 당신들의 작업에 대해 이야기하는 것을 들었습니다. 그는 당신들이 시마라고 부르는 에이전트가 지니 에이전트와 상호작용할 수 있다고 언급했습니다. 그가 설명하는 것을 들으면서 제 정신이 번쩍 들었습니다. 즉, 하나의 시뮬레이션 에이전트가 세계에, 즉 지니 에이전트에게 실시간 환경을 생성해 달라고 요청하여 그 안에서 상호작용하는 것입니다. 그때 제가 깨달은 것은 당신들이 그것을 구축한 방식이 다른 에이전트와 조합 가능하다는 것이었습니다.
- - 마크가 말했듯이, 그것이 로봇 공학에 왜 그렇게 중요한지, 그리고 현재 로봇 공학의 발전 속도를 훨씬 빠르게 만들기 위해 우리가 극복해야 할 주요 한계는 무엇인지에 대해 이야기해 줄 수 있을까요?
- - 잭: 우리는 지니 3를 에이전트가 아닌 환경으로 설계했습니다. 그래서 지니 3는 환경 모델에 가깝습니다. 우리는 그것을 세상에서 생각하고 행동할 수 있는 에이전트 자체로 보지 않습니다. 오히려 에이전트를 위한 경험을 시뮬레이션할 수 있는 범용 시뮬레이터와 같습니다. 우리는 경험을 통해 학습하는 것이 에이전트에게 정말 중요한 패러다임이라는 것을 알고 있습니다. 알파고가 바둑을 스스로 두면서 새로운 것을 시도하고 피드백을 통해 학습하여 스스로를 개선하면서 알파고가 생겨났습니다. 알파고는 인간이 가치 있다고 생각하지 않았던 37번째 수에서 새로운 수를 발견했습니다. 직접 경험하고 시도할 수 있었기 때문입니다.
- - 로봇 공학에서는 현재 데이터 기반 접근 방식이 있습니다. 이것은 꽤 힘든 방식으로 데이터를 수집할 수 있지만, 하위 작업과 비슷하게 보이고 현실처럼 보입니다. 두 도메인 사이에 큰 불일치는 없습니다. 또는 시뮬레이션에서 학습할 수도 있습니다. 그러나 로봇 시뮬레이션은 최고 수준의 시뮬레이션조차도 (우리는 딥마인드에서 작업하는 마조코와 같은 최고의 시뮬레이션을 가지고 있습니다) 실제 세계와는 거리가 멉니다. 그래서 '심 투 리얼 갭'이라는 것이 있습니다. 그러나 '심 투 리얼 갭' 자체도 이름이 잘못되었다고 생각합니다. 왜냐하면 사람들이 로봇 공학에서 '현실'이라고 생각하는 것은 일반적으로 여전히 실험실이거나, 로봇에 여러 스포트라이트가 비추고 수많은 연구원들이 둘러싸여 지켜보고 있는 매우 제한적인 환경이기 때문입니다.
- - 반면에 저에게 진정한 '현실'은 제가 너무 바빠서 목줄을 잡을 수 없을 때 강아지를 산책시키고, 길을 건너고, 강아지를 무서워하는 사람을 보면 그들을 피해가고, 공을 가진 사람을 보면 방향을 바꾸는 등 실제 세계의 모든 어려운 상황을 의미합니다. 물론 여전히 쥐는 것과 같은 다른 작업들도 있지만, 자신의 경험을 통해 자신의 행동을 실제로 발견해야 합니다. 물리적으로 구현된 세계에서 그렇게 하는 것은 매우 어렵습니다. 첫째, 그러한 환경에서 데이터를 수집하는 것이 비쌀 수 있기 때문입니다. 로봇이 잘못된 행동을 할 때마다 원래 위치로 계속 되돌려 놓아야 할 것입니다. 또한 안전하지 않을 수도 있습니다. 그래서 물리적 세계에서 경험을 통해 학습을 실제로 할 수 없는 많은 이유가 있습니다. 그래서 우리는 시뮬레이션에서 그렇게 합니다. 그러나 지니 3를 통해 우리는 양쪽의 장점을 모두 얻을 수 있다고 생각합니다. 실제 세계의 데이터 기반 접근 방식을 사용하면서도 시뮬레이션에서 학습할 수 있는 능력을 가지고 있기 때문입니다. 그래서 저는 그것이 로봇 예시뿐만 아니라 매우 강력할 수 있다고 생각합니다. 런던에 비가 많이 올 때, 강아지를 두 번째 산책시키지 않아도 된다는 이 아이디어가 정말 좋습니다.
- - 슐로미: 보시다시피 우리는 기본적으로 잭의 개인적인 애플리케이션을 위해 모델을 만들었습니다. 그것이 프로젝트를 주도하고 있습니다. 네, 보시다시피 잭, 이제 캘리포니아로 이사할 때입니다. 그게 해결책입니다. 비도 덜 오고, 시차도 덜 납니다. 저는 개인적으로 캘리포니아를 좋아하지만, 제 아내는 설득되지 않았습니다. 죄송합니다. 우리는 여기에서 확신합니다.
- - 로봇 공학 부분에 대해 마지막으로 말씀드리자면, 로봇 공학은 분명히 시각적인 것 이상을 의미합니다. 우리는 로봇의 결정을 주변을 둘러보며 유도할 수 있어야 하지만, 로봇은 여전히 행동을 수행하고, 어디로 움직일지, 환경에 어떻게 반응할지 결정해야 합니다. 그래서 분명히 몇 가지 간극이 있지만, 문제의 핵심에서 환경을 추론할 수 있다는 것은 지니 3와 같은 범용 세계 모델이 정말 도움이 될 수 있다고 생각합니다. 그리고 미래 연구를 통해 물리적 이해의 간극과 실제로 세계로부터 물리적 반응을 얻는 간극을 메울 수 있을 것입니다. 그것은 매우 흥미로운 탐구 방향입니다.
- - 마지막 질문입니다. 이것이 공개될까요? 개발자들이 언젠가 접근할 수 있을까요? 아니면 어떤 종류의 아이디어가 있나요? 보시다시피 우리는 더 많은 사람들이 접근할 수 있게 되는 것에 대해 매우 기대하고 있습니다. 그래서 우리는 분명히 그렇게 되기를 원합니다. 현재로서는 구체적인 타임라인은 없지만, 공유할 것이 더 많아지면 분명히 공유할 것입니다.
- - 마크: 멋집니다. 제가 많이 생각했던 것 중 하나는 모든 모달리티, 즉 아마도 처음에는 LLM, 그 다음에는 이미지와 비디오, 오디오에서 흥미로운 프로젝트나 연구 미리 보기에서 초기 반짝임을 보고, 그 다음에는 엄청난 양의 데이터와 컴퓨팅, 그리고 연구자들이 문제에 투입되어 데이터가 고갈되거나 개선이 쉽게 이루어지지 않는 지점에 도달할 때까지 기하급수적인 발전을 보게 됩니다. 세계 모델의 곡선에서 우리가 어디에 있는지에 대한 당신의 생각을 궁금합니다.
- - 잭: 정말 좋은 질문입니다. 저는 사실 매우 불분명하고 다소 회피적인 답변을 가지고 있습니다. 그리고 저는 그것이 사실 둘 다라고 생각합니다. 현재 기능들은 이미 꽤 매력적이라고 생각합니다. 그래서 당신이 원했던 것이 메모리가 있는 포토리얼리스틱한 임의의 세계 생성이라면 그것이 최종 목표가 될 수 있다고 주장할 수도 있습니다. 그리고 2, 3년 전이라면 저는 그것이 5년 목표라고 말했을 것입니다. 그리고 그 시점에서 당신이 그것을 개선하기를 원했다면, 아마도 지니 2에서 지니 3로의 도약은 정말 엄청났고, 멋진 연구에서 생명의 징후를 보이는 것에서 이미 매우 매력적인 무언가로 바뀌었다고 생각합니다. 그러나 이것으로 할 수 있는 일은 훨씬 더 많다고 생각합니다. 슐로미 님도 직접 언급했듯이, 당신이 세상에 발을 들여놓는다고 해서 실제 세상에 있는 것과 같은 것은 아닙니다. 컴퓨터 화면에서 1분 동안 눈을 떼면 실제 세상은 훨씬 더 풍부합니다. 그리고 그것은 실제 세계에만 해당됩니다. 우리는 완전히 새로운 것을 생성할 수 있는 능력도 원합니다.
- - 그래서 우리는 닫아야 할 엄청난 간극이 있다고 생각합니다. 즉, 추가하고 싶은 새로운 기능들을 말이죠. 그러나 언어 모델과는 약간 다를 수도 있고, 사실 언어 모델과 비슷할 수도 있습니다. 그러나 언어 모델에는 실제로 많은 새로운 단계들이 추가되었는데, 우리가 가능하다고 생각하지 않았던 것들이었습니다. 우리는 정체기에 접어들고 있다고 생각했지만, 새로운 아이디어가 나와서 상당한 변화를 가져왔습니다. 그리고 지난 몇 년 동안 몇 번 그런 일이 있었습니다. 그래서 저는 분명히 몇 가지 더 남아있다고 생각합니다.
- - 마지막 질문입니다. 우리는 시뮬레이션 속에 살고 있나요? 네, 그 질문은 제가 매번 생각하는 것입니다. 저는 그것에 대해 좀 생각해 봤습니다. 우리가 시뮬레이션 속에 살고 있다면, 제 생각에는 현재 하드웨어에서 실행되지 않을 것입니다. 왜냐하면 그것은 아날로그이고, 당신도 알다시피 연속적이지 않고, 모든 관찰이 연속적이며 아무것도 없기 때문입니다. 그러나 아마도 양자 수준은 우리가 실행하는 시뮬레이션의 하드웨어 한계일 것입니다. 네, 철학적으로 가고 싶으셨으니 그렇게 하겠습니다. 받아들이든 말든요. 훌륭한 대답입니다. 분명히 TPU 팀이 할 일이 많겠네요.
- - 아마 양자 컴퓨팅이 실제로 우리의 실제 시뮬레이션을 실행할 것입니다. 네, 정말 좋은 마무리입니다. 슐로미, 잭, 팟캐스트에 와주셔서 정말 감사합니다. 초대해 주셔서 감사합니다.
---
- 감사합니다.
네, 소스에 따르면 진행자가 구글 딥마인드 연구원들에게 "우리가 시뮬레이션 속에 살고 있나요?"라고 질문했습니다 [1].
이에 대한 슈로미의 답변은 다음과 같습니다 [1, 2]:
* 만약 우리가 시뮬레이션 속에 살고 있다면, **현재 우리가 사용하는 하드웨어로는 실행되지 않을 것**이라고 생각합니다 [1].
* 그 이유는 우리 세계의 관찰 가능한 모든 것이 아날로그적이고 연속적이기 때문입니다. 이는 현재의 디지털 하드웨어와는 다르다고 설명했습니다 [1].
* 슈로미는 **양자 수준이 우리가 실행되고 있는 시뮬레이션의 하드웨어적 한계**일 수 있다고 추측했습니다 [1, 2].
* 그는 심지어 양자 컴퓨팅이 실제 우리의 시뮬레이션을 실행하고 있을 수도 있다고 덧붙였습니다 [2].
요약하자면, 연구원들은 이 질문에 대해 개인적인 추측을 밝혔으며, 특히 현재의 디지털 컴퓨팅 방식과 우리의 연속적인 현실 사이의 차이점을 언급했습니다 [1, 2].
철학적인 답변은 우리가 시뮬레이션 안에 살고 있다는 것을 **명확하게 단정하지는 않습니다.** [1]
대신, 슈로미는 **"만약 우리가 시뮬레이션 안에 살고 있다면"** [1]이라는 가정을 전제로 자신의 견해를 밝힙니다.
그의 주요 논점은 다음과 같습니다:
* 그는 우리가 시뮬레이션 안에 살고 있다면, 현재 우리의 하드웨어(디지털)로는 그 시뮬레이션이 실행되지 않을 것이라고 생각합니다 [1].
* 이는 우리의 모든 관찰이 **아날로그적이고 연속적이기 때문**이라고 설명합니다 [1].
* 어쩌면 양자 수준이 우리가 실행되는 시뮬레이션의 하드웨어적 한계일 수도 있다고 추측하며, 미래에는 **양자 컴퓨팅이 우리의 실제 시뮬레이션을 실행할 수도 있다**는 가능성을 언급합니다 [1, 2].
결론적으로, 슈로미는 우리가 시뮬레이션 안에 있는지에 대해 확실한 답을 내리기보다는, 만약 그렇다면 어떻게 작동할 것인지에 대한 흥미로운 철학적 고찰을 제공합니다 [1, 2].