Fei-Fei Li - 공간 지능은 AI의 다음 개척지
-- 제 경력 전체는 터무니없을 정도로 어려운 문제들을 추구하는 데 바쳐졌습니다. 저에게 AGI는 공간 지능 없이는 완성될 수 없을 것이며, 저는 그 문제를 해결하고 싶습니다. 저는 기업가로서 일하는 것을 정말 좋아합니다. 과거에 무엇을 했는지, 다른 사람들이 당신을 어떻게 생각하는지는 잊으십시오. 그저 묵묵히 만들고 구축하십시오. 그것이 저의 편안한 영역입니다.
-- 그래서 오늘 이 자리에 페이 페이 리 박사님을 모시게 되어 정말 기쁩니다. 그녀는 AI 분야에서 매우 오랜 경력을 가지고 있습니다. 많은 분들이 그녀를 아실 것이라고 확신합니다. 손을 들어보세요. 저도 아는 분이시죠. 그녀는 AI의 대모로 불려왔습니다. 당신이 만든 첫 프로젝트 중 하나는 2009년에 이미지넷이었습니다. 16년 전이군요. 오, 이런, 그것을 떠올리게 하지 마세요. 그것은 8만 개 이상의 인용을 받았고, AI의 중요한 기반 중 하나인 데이터 문제를 정말로 시작하게 했습니다. 그 프로젝트가 어떻게 시작되었는지 말씀해 주시겠어요? 그때는 꽤 선구적인 작업이었죠. 네, 우선 다이애나와 게리 그리고 모든 분들, 여기에 초대해 주셔서 감사합니다. 여기에 오게 되어 너무 기쁩니다. 왜냐하면 제가 여러분 중 한 명이라고 느끼기 때문입니다. 저도 지금 기업가입니다. 방금 작은 회사를 시작했습니다. 그래서 여기에 오게 되어 매우 기쁩니다.
-- 이미지넷은, 네, 맞습니다. 우리는 실제로 그것을 거의 18년 전에 구상했습니다. 시간은 정말 빨리 흘러갑니다. 저는 프린스턴에서 1년차 조교수였습니다. 오, 멋지네요. 타이거즈 여러분, 안녕하세요? 그리고 그 당시 AI와 머신러닝의 세계는 너무나 달랐습니다. 데이터가 거의 없었고, 적어도 컴퓨터 비전에서는 알고리즘이 작동하지 않았습니다. 산업도 없었습니다. 대중에게 AI라는 단어조차 존재하지 않는 것처럼 보였습니다. 그러나 존 매카시와 같은 AI의 창시자들로부터 시작하여 제프 힌튼 같은 사람들을 거쳐 우리는 여전히 한 그룹의 AI 꿈을 가지고 있었습니다. 우리는 정말로 기계가 생각하고 작동하게 만들고 싶었습니다. 그 꿈과 함께 저의 개인적인 꿈은 기계가 볼 수 있게 만드는 것이었습니다. 왜냐하면 보는 것은 지능의 초석이기 때문입니다. 시각 지능은 단순히 인지하는 것이 아니라, 세상을 정말로 이해하고 세상에서 어떤 일을 하는 것입니다. 그래서 저는 기계가 볼 수 있게 만드는 문제에 집착했고, 그 당시 머신러닝 알고리즘을 강박적으로 개발하면서 뉴로넷 네트워크를 시도했지만 작동하지 않았습니다. 우리는 베이즈넷과 서포트 벡터 머신 등으로 방향을 전환했습니다.
-- 무엇이든 간에, 하지만 한 가지 문제가 항상 저를 괴롭혔는데, 그것은 일반화 문제였습니다. 머신러닝을 다룬다면, 일반화가 머신러닝의 핵심적인 수학적 기반이자 목표라는 것을 인정해야 합니다. 그리고 일반화하기 위해서는 이러한 알고리즘에 데이터가 필요합니다. 그러나 당시 컴퓨터 비전 분야에는 아무도 데이터를 가지고 있지 않았습니다. 저는 데이터를 다루기 시작한 첫 세대 대학원생이었습니다. 왜냐하면 제가 거대한 사물 인터넷을 본 첫 세대 대학원생이었기 때문입니다.
-- 그래서 시간을 빨리 돌려서, 2007년경에 제 학생과 저는 과감한 시도를 해야 한다고 결정했습니다. 우리는 머신러닝에 패러다임 전환이 필요하며, 그 패러다임 전환은 데이터 기반 방법론에 의해 주도되어야 한다고 확신해야 했습니다. 그리고 데이터는 없었습니다. 그래서 우리는 "좋아, 인터넷에 가서 10억 개의 이미지를 다운로드하자"라고 생각했습니다. 그것이 인터넷에서 얻을 수 있는 가장 많은 숫자였고, 전 세계의 시각 분류 체계를 만들었습니다. 그리고 그것을 사용하여 머신러닝 알고리즘을 훈련하고 벤치마킹했습니다. 그것이 이미지넷이 구상되고 현실화된 이유입니다. 유망한 알고리즘이 나올 때까지는 시간이 좀 걸렸습니다. 알렉스넷이 나온 2012년이 되어서야 비로소 그렇게 되었습니다. 그리고 그것은 AI에 도달하기 위한 방정식의 두 번째 부분이었습니다. 즉, 컴퓨팅 능력을 확보하고 충분한 데이터를 투입하고 알고리즘을 사용하는 것이었습니다.
-- 데이터를 제공하고 나서 사람들이, 즉 커뮤니티가 AI를 위해 더 많은 것을 알아내기 시작한 그 순간에 대해 말씀해 주시겠어요? 네, 2009년에 이 작은 CVPR 포스터를 발표한 것부터 2012년 알렉스넷까지 3년 동안 우리는 데이터가 AI를 이끌 것이라고 정말로 믿었지만, 그것이 작동하는지에 대한 신호는 거의 없었습니다. 그래서 우리는 몇 가지 일을 했습니다. 하나는 오픈소스화한 것입니다. 우리는 처음부터 이 모든 연구 커뮤니티가 이 작업을 할 수 있도록 오픈소스화해야 한다고 믿었습니다. 우리가 한 또 다른 일은 챌린지를 만든 것입니다. 왜냐하면 우리는 전 세계의 가장 똑똑한 학생들과 연구자들이 이 문제에 대해 연구하기를 원했기 때문입니다. 그래서 그것이 우리가 이미지넷 챌린지라고 부르는 것이었습니다. 그래서 매년 우리는 테스트 데이터셋을 공개합니다. 물론 전체 이미지넷은 훈련용으로 제공되지만, 우리는 테스트용을 공개합니다.
-- 그리고 우리는 모든 사람을 공개적으로 참여하도록 초대했고, 처음 몇 년은 정말로 기준선을 설정하는 것이었습니다. 아시다시피 성능은 30%의 오류율을 보였습니다. 0%는 아니었고, 완전히 무작위적인 것도 아니었지만, 그리 좋지는 않았습니다. 그러나 2012년 세 번째 해에, 제가 출판한 책에 썼지만 여전히 기억합니다. 여름이 끝날 무렵, 우리가 이미지넷 챌린지의 모든 결과를 서버에서 실행하고 있었습니다. 그리고 어느 날 늦은 밤, 집에 있던 저는 대학원생으로부터 핑을 받았습니다. 그는 정말 눈에 띄는 결과가 나왔으니 확인해 보라고 했습니다. 우리는 그것을 살펴보았습니다. 그것은 컨볼루션 뉴럴 네트워크였습니다. 당시에는 알렉스넷이라고 불리지 않았습니다. 제프 힌튼 팀은 슈퍼비전이라고 불렸습니다. 그것은 '슈퍼'라는 단어와 지도 학습을 영리하게 결합한 말이었습니다.
-- 그래서 슈퍼비전과 슈퍼비전이 한 일을 살펴보았습니다. 그것은 오래된 알고리즘이었습니다. 컨볼루션 뉴럴 네트워크는 1980년대에 발표되었습니다. 알고리즘에는 몇 가지 수정이 있었지만, 그런 큰 변화가 있다는 것을 처음에는 상당히 놀랐습니다. 그리고 물론, 나머지는 여러분 모두가 아시다시피, 우리는 그해 이탈리아 피렌체에서 열린 ICCV의 이미지넷 챌린지 워크숍에서 이것을 발표했습니다. 알렉스 크루시브스키가 왔고 많은 사람들이 왔습니다. 영락도 왔던 것으로 기억합니다. 그리고 이제 전 세계는 이 순간을 이미지넷 챌린지 알렉스넷 순간으로 알고 있습니다. 저는 그것이 단순히 컨볼루션 뉴럴 네트워크만이 아니었다는 것을 말하고 싶습니다. 그것은 또한 알렉스와 그의 팀이 두 개의 GPU를 처음으로 함께 사용하여 딥러닝 컴퓨팅에 사용한 순간이기도 했습니다. 그래서 그것은 정말로 데이터, GPU, 그리고 뉴럴 네트워크가 함께 모인 첫 순간이었습니다.
-- 이제 컴퓨터 비전을 위한 지능의 흐름을 따라, 이미지넷은 객체 인식의 개념을 해결하는 데 정말로 씨앗이었습니다. 그 직후 AI는 장면을 해결할 수 있는 지점까지 도달하기 시작했습니다. 왜냐하면 앤드류 카파시와 같은 당신의 학생들과 함께 많은 작업이 있었기 때문에 장면을 묘사할 수 있었습니다. 객체에서 장면으로의 그 전환에 대해 말씀해 주시겠어요?
-- 네, 이미지넷은 이미지가 주어지면 객체를 식별하는 문제를 해결했습니다. 고양이가 있고, 의자가 있고, 그런 것들이요. 그것은 시각 인식의 근본적인 문제입니다. 그러나 제가 AI 분야에 발을 들여놓은 대학원생 시절부터 꿈이 있었습니다. 저는 그것이 100년짜리 꿈이라고 생각했습니다. 그것은 세상에 대한 스토리텔링인데, 즉 인간이 눈을 떴을 때, 예를 들어 이 방에서 눈을 떴다고 상상해 보세요. 당신은 단순히 사람, 사람, 의자, 의자, 의자만 보는 것이 아닙니다. 당신은 실제로 스크린과 무대, 사람들과 군중, 카메라가 있는 회의실 전체 장면을 묘사할 수 있습니다. 그것은 시각 지능의 기초가 되는 인간의 능력이며, 우리의 일상생활에서 사용하기에 매우 중요합니다.
-- 그래서 저는 그 문제가 제 평생을 걸릴 것이라고 정말 생각했습니다. 저는 말 그대로 대학원생으로 졸업할 때, 죽기 전에 장면의 이야기를 들려줄 수 있는 알고리즘을 만들 수 있다면 성공했다고 스스로에게 말했습니다. 그것이 제가 제 경력을 생각했던 방식입니다. 알렉스넷의 순간이 왔고, 딥러닝이 비약적으로 발전했습니다. 그리고 앙드레와 나중에 저스틴 존슨이 제 연구실에 들어왔을 때, 우리는 자연어와 비전이 충돌하기 시작하는 신호들을 보기 시작했습니다. 그리고 앙드레와 저는 이미지 캡셔닝 또는 스토리텔링 문제를 제안했습니다.
-- 간단히 말해서, 2015년경에 앙드레와 저는 이미지에 캡션을 달아주는 컴퓨터를 실제로 만드는 일련의 논문을 발표했는데, 이는 몇몇 동시 논문들과 함께 초기에 해당되는 작업이었습니다. 저는 거의 "내 인생을 어떻게 해야 할까?"라고 느꼈습니다. 그것이 제 평생의 목표였으니까요. 그것은 우리 둘 모두에게 정말 놀라운 순간이었습니다. 그리고 작년에 저는 테드 강연을 했고, 실제로 앙드레가 이미지 캡셔닝 작업을 마칠 무렵 몇 년 전에 트윗한 것을 사용했습니다. 그것은 거의 그의 박사 논문이었습니다. 저는 그에게 농담으로 "야, 앙드레, 문장을 받아서 이미지를 생성하는 반대 작업을 해보는 건 어때?"라고 말했습니다. 물론 그는 제가 농담하는 것을 알았고, "하하, 전 이만 가겠습니다."라고 말했습니다. 세상은 아직 준비되지 않았습니다.
-- 그러나 이제 시간이 흘러 우리는 모두 생성형 AI를 알고 있습니다. 이제 우리는 문장을 받아 아름다운 그림을 생성할 수 있습니다. 그래서 이 이야기의 교훈은 AI가 놀라운 성장을 이루었다는 것입니다. 그리고 개인적으로 저는 세상에서 가장 운이 좋은 사람이라고 생각합니다. 왜냐하면 제 경력 전체가 AI 겨울이 끝나가는 아주 초기에, AI가 도약하기 시작하는 시기에 시작되었고, 제 작업과 제 경력의 많은 부분이 이러한 변화의 일부이거나 이 변화에 기여했기 때문입니다. 그래서 저는 너무나 행운아라고 생각하고, 어떤 면에서는 자랑스럽습니다.
-- 그리고 가장 놀라운 점은, 장면을 묘사하고 확산 모델로 생성하는 평생의 꿈을 이루었음에도 불구하고, 당신은 사실 더 큰 꿈을 꾸고 있다는 것입니다. 왜냐하면 컴퓨터 비전의 전체 흐름이 객체에서 장면으로, 이제는 세계라는 개념으로 나아갔기 때문입니다. 그리고 당신은 실제로 교수라는 학계의 위치에서 월드 랩스의 창립자이자 CEO가 되기로 결정했습니다. 월드 랩스가 무엇인지 말씀해 주시겠어요? 그것은 장면과 객체보다 훨씬 더 어렵습니다. 네, 그렇습니다. 꽤 놀라운 일입니다.
-- 그래서 물론 여러분 모두는 지난 5, 6년을 요약하기가 정말 어렵다는 것을 아실 겁니다. 저에게는 우리가 이 기술 발전의 문명적인 순간을 살고 있다는 느낌입니다. 컴퓨터 비전 과학자로서 우리는 이미지넷에서 이미지 캡셔닝, 그리고 일부 확산 기술을 사용한 이미지 생성에 이르기까지 이러한 놀라운 성장을 목격하고 있습니다. 이것이 매우 흥미로운 방식으로 일어나고 있는 동안, 우리는 또한 또 다른 매우 흥미로운 흐름인 언어, 즉 LLM을 가지고 있습니다. 이것은 2022년 11월 챗GPT가 진정으로 작동하는 생성 모델의 문을 활짝 열었고, 이 모델은 기본적으로 튜링 테스트를 통과할 수 있습니다. 그래서 이러한 점은 저처럼 나이 든 사람에게도 다음에는 무엇이 올지에 대해 대담하게 생각하게 하는 매우 큰 영감을 줍니다.
-- 그리고 저는 컴퓨터 비전 과학자로서 습관이 있습니다. 제 영감의 많은 부분이 진화와 뇌 과학에서 나옵니다. 저는 제 경력의 많은 순간에서 해결해야 할 다음 북극성 문제를 찾을 때마다 스스로에게 묻습니다. "진화가 무엇을 했고, 뇌 발달이 무엇을 했는가?" 그리고 주목하거나 감사해야 할 정말 중요한 것이 있습니다. 진화에서 인간 언어의 발달은, 아주 관대하게 말해서, 약 3억에서 5억 년 미만의 시간이 걸렸습니다. 그것이 인간 언어를 개발하는 데 걸린 진화의 시간입니다.
-- 3억에서 5억 년 미만입니다. 그것이 인간 언어를 개발하는 데 걸린 진화의 길이입니다. 그리고 인간은 정교한 언어를 가진 거의 유일한 동물입니다. 동물 언어에 대해 논할 수는 있겠지만, 의사소통, 추론, 추상화의 도구로서 언어의 전체적인 측면에서 볼 때 그것은 정말 인간의 것입니다. 그래서 그것은 50만 년도 채 걸리지 않았습니다. 그러나 시각에 대해 생각해 보십시오. 3D 세계를 이해하고, 이 3D 세계에서 무엇을 할지 파악하고, 3D 세계를 탐색하고, 3D 세계와 상호작용하고, 3D 세계를 이해하고, 3D 세계를 소통하는 능력에 대해 생각해 보십시오. 그 여정은 진화에 5억 4천만 년이 걸렸습니다. 최초의 삼엽충은 5억 4천만 년 전에 수중에서 시각을 발달시켰습니다.
-- 그리고 그 이후로 시각은 진화적 군비 경쟁을 촉발시킨 진정한 이유였습니다. 시각이 있기 전에는 동물들은 단순했습니다. 시각이 있기 전 반억 년 동안은 그저 단순한 동물들이었습니다. 그러나 다음 반억 년, 5억 4천만 년 동안은 세상을 보고 이해하는 능력 때문에 진화적 군비 경쟁이 시작되었고, 동물 지능은 서로 경쟁하기 시작했습니다.
-- 그래서 저에게는 공간 지능의 문제를 해결하는 것, 즉 3D 세계를 이해하고, 3D 세계를 생성하고, 3D 세계에 대해 추론하고, 3D 세계에서 어떤 일을 하는 것은 AI의 근본적인 문제입니다. 저에게 AGI는 공간 지능 없이는 완성되지 않을 것이며, 저는 그 문제를 해결하고 싶습니다. 그리고 그것은 평면 픽셀을 넘어서는 세계 모델, 언어를 넘어서는 세계 모델, 세계의 3D 구조와 공간 지능을 진정으로 포착하는 세계 모델을 만드는 것을 포함합니다. 그리고 제 인생에서 가장 운이 좋은 것은 제가 아무리 나이가 들어도 항상 최고의 젊은이들과 함께 일할 수 있다는 것입니다.
-- 그래서 저는 저스틴 존슨, 벤 밀든홀, 크리스토프 라스너라는 세 명의 믿을 수 없을 정도로 젊지만 세계적인 수준의 기술자들과 함께 회사를 설립했고, 우리는 제 생각에 현재 AI에서 가장 어려운 문제인 엄청난 재능을 가진 문제를 해결하려고 합니다. 크리스는 Pulsar의 창시자였습니다. Pulsar는 Gosh와 Splats가 차분 렌더링을 많이 하기 전의 초기 씨앗이었습니다. 당신의 전 학생인 저스틴 존슨은 정말로 실시간 신경 스타일 전송을 가능하게 한 뛰어난 시스템 엔지니어링 마인드를 가지고 있습니다. 그리고 널프 논문의 저자인 벤도 있습니다.
-- 그래서 이 팀은 정말 최고의 팀이며, 이런 최고 팀이 필요합니다. 왜냐하면 우리가 비전이 LLM보다 어느 정도 더 어렵다는 것에 대해 이야기했기 때문입니다. 이것은 논란의 여지가 있는 말일 수도 있습니다. 왜냐하면 LLM은 기본적으로 1D이기 때문입니다. 하지만 당신은 많은 3D 구조를 이해하는 것에 대해 이야기하고 있습니다. 왜 이렇게 어렵고, 언어 연구에 비해 뒤쳐져 있나요? 네, 우리 문제가 얼마나 어려운지 공감해 주셔서 정말 감사합니다.
-- 네, 언어는 근본적으로 1D입니다. 음절은 순서대로 나옵니다. 이것이 시퀀스-투-시퀀스 모델링이 그렇게 고전적인 이유입니다. 사람들이 언어에 대해 인식하지 못하는 또 다른 점이 있습니다. 언어는 순전히 생성적입니다. 자연에는 언어가 없습니다. 언어를 만지거나 볼 수 없습니다. 언어는 말 그대로 모든 사람의 머리에서 나오며, 그것은 순전히 생성적인 신호입니다. 물론 종이에 적으면 거기에 있지만, 언어의 생성, 구성, 유용성은 매우 생성적입니다.
-- 세상은 그것보다 훨씬 더 복잡합니다. 첫째, 실제 세계는 3D입니다. 그리고 시간에 추가하면 4D가 됩니다. 하지만 공간에만 한정해 봅시다. 그것은 근본적으로 3D입니다. 그래서 그 자체로 훨씬 더 조합론적으로 어려운 문제입니다. 둘째, 시각 세계를 감지하고 수용하는 것은 투영입니다. 눈이든 망막이든 카메라든 항상 3D를 2D로 압축합니다. 그리고 당신은 그것이 얼마나 어려운지 이해해야 합니다. 그것은 수학적으로 불량합니다. 그래서 이 때문에 인간과 동물은 다중 센서를 가지고 있습니다. 그리고 그 문제를 해결해야 합니다.
-- 그리고 셋째, 세상은 순전히 생성적이지 않습니다. 네, 우리는 가상 3D 세계를 생성할 수 있습니다. 그것은 여전히 물리학 등을 따라야 합니다. 그러나 실제 세계도 존재합니다. 당신은 이제 생성과 재구성 사이를 매우 유연하게 오가고 있습니다. 그리고 사용자 행동, 유용성, 사용 사례가 매우 다릅니다. 만약 당신이 생성에만 초점을 맞춘다면, 우리는 게임과 메타버스 등에 대해 이야기할 수 있습니다. 만약 당신이 실제 세계에만 초점을 맞춘다면, 우리는 로봇 공학 등에 대해 이야기하는 것입니다. 하지만 이 모든 것은 세계 모델링과 공간 지능의 연속체입니다.
-- 그래서 이것은 그리고 물론 가장 큰 문제는 언어에 대한 데이터는 인터넷에 많지만 공간 지능을 위한 데이터는 어디에 있느냐 하는 것입니다. 물론 그것은 우리 머리 속에 있지만 언어만큼 쉽게 접근할 수 없습니다.
-- 그래서 이것들이 그렇게 어려운 이유이지만, 솔직히 말해서 저는 흥분됩니다. 왜냐하면 만약 쉬웠다면 다른 누군가가 이미 해결했을 것이고, 제 경력 전체는 터무니없을 정도로 어려운 문제들을 쫓는 데 바쳐졌기 때문입니다. 그리고 저는 이것이 바로 그 터무니없는 문제라고 생각합니다. 그것을 지지해 주셔서 감사합니다.
-- 그리고 첫 번째 원칙에서부터 이것을 생각해보면, 인간의 뇌는 언어보다 시각 피질에 훨씬 더 많은 뉴런을 가지고 있으며, 시각 데이터를 처리하는 뉴런의 수도 많습니다. 이것이 LLM과 매우 다른 모델 아키텍처로 어떻게 변환되나요? 당신이 알아내고 있는 것과 말이죠. 네, 그것은 정말 좋은 질문입니다. 그리고 여전히 다양한 학파들이 존재합니다. LLM에서 우리가 보는 많은 부분은 정말로 스케일링 법칙을 행복한 결말까지 끌고 가는 것이고, 거의 무차별적으로 자기 지도 학습을 할 수 있습니다. 구성적 세계 모델은 좀 더 미묘할 수 있습니다. 세계는 더 구조화되어 있고, 우리가 그것을 안내하는 데 사용해야 할 신호들이 있을 수 있습니다. 그것을 사전 지식의 형태로 부르든, 데이터의 감독이라고 부르든, 무엇이든 간에, 이것들이 우리가 해결해야 할 몇 가지 열린 질문이라고 생각합니다.
-- 그러나 당신이 옳습니다. 또한 인간을 생각해보면, 우선 인간 지각에 대한 모든 답을 가지고 있지 않습니다. 인간 시각에서 3D가 어떻게 작동하는지는 해결되지 않은 문제입니다. 우리는 두 눈이 기계적으로 정보를 삼각 측량해야 한다는 것을 알고 있지만, 그 이후의 수학적 모델은 어디에 있으며, 우리는 3D 동물로서 그렇게 뛰어나지 않습니다.
-- 그래서 해결해야 할 많은 것들이 있습니다. 그래서 우리는 월드 랩에서 한 가지에 정말로 의존하고 있습니다. 우리는 이 문제를 해결하기 위해 픽셀 세계에서 가장 똑똑한 사람들을 가지고 있다는 것에 의존하고 있습니다. 월드 랩스에서 구축하고 있는 것이 3D 세계를 출력으로 하는 완전히 새로운 기반 모델이라고 말하는 것이 공정할까요? 그리고 어떤 응용 프로그램을 구상하고 계신가요? 왜냐하면 당신은 지각부터 생성까지 모든 것을 나열했기 때문입니다.
-- 구상하고 있는 응용 프로그램들인데, 당신은 지각부터 생성까지 모든 것을 나열했기 때문입니다. 그래서 생성 모델과 판별 모델 사이에는 항상 이러한 긴장감이 있습니다. 그래서 우리가, 즉 이러한 3D 세계가 하는 일은 무엇인가요? 네, 제가 월드 랩스의 세부 사항에 대해 너무 많이 이야기할 수는 없겠지만, 공간 지능 측면에서는 그것이 저를 흥분시키는 부분이기도 합니다. 언어와 마찬가지로, 사용 사례는 창작에서부터 정말로 거대합니다. 창작이라면 디자이너, 건축가, 산업 디자이너, 그리고 3D 아티스트와 게임 개발자를 생각할 수 있습니다. 창작에서 로봇 공학, 로봇 학습에 이르기까지 공간 지능 모델 또는 세계 모델의 유용성은 정말로 거대합니다.
-- 그래서 마케팅에서 엔터테인먼트, 심지어 메타버스에 이르기까지 많은 관련 산업들이 있습니다. 저는 사실 메타버스에 정말 흥분하고 있습니다. 많은 사람들이 아직 잘 작동하지 않는다고 생각한다는 것을 알고 있습니다. 네, 아직 작동하지 않는다는 것을 저도 알고 있습니다. 그래서 제가 흥분하는 이유입니다. 왜냐하면 하드웨어와 소프트웨어의 융합이 올 것이라고 생각하기 때문입니다. 그래서 그것 또한 앞으로 훌륭한 사용 사례가 될 것입니다. 저는 개인적으로 당신이 메타버스를 해결하고 있다는 것에 매우 흥분됩니다. 저는 이전 회사에서 시도해 본 적이 있습니다. 그래서 당신이 지금 그것을 하고 있다는 것에 너무 기쁩니다. 네, 글쎄요, 저는 더 많은 신호가 있다고 생각합니다. 하드웨어가 장애물의 일부라고 생각하지만, 아시다시피 콘텐츠 생성이 필요하고, 메타버스 콘텐츠 생성에는 세계 모델이 필요합니다.
-- 이제 주제를 좀 바꿔봅시다. 그래서 청중 중 일부는 당신이 학계에서 교수직을 그만두고 이제 창립자 겸 CEO가 된 것에 대해 갑작스럽다고 생각할 수도 있지만, 당신은 실제로 평생 동안 놀라운 여정을 거쳐왔습니다. 0에서 1을 만든 것이 이번이 처음이 아닙니다. 당신은 십대 때 미국으로 이민 와서 영어를 전혀 못했고, 심지어 몇 년 동안 세탁소를 운영했다고 말씀해 주셨습니다. 그 모든 기술들이 지금의 당신을 어떻게 형성했는지 말씀해 주시겠어요? 네, 여러분이 여기에 세탁소를 시작하는 방법을 들으러 오신 것 같군요. 음, 네, 그때 당신은 19살이었죠? 네, 저는 19살이었고 그것은 절박함에서 나온 것이었습니다. 그래서 저는 가족과 부모님을 부양할 방법이 없었고, 프린스턴에서 물리학을 전공하기 위해 대학에 가야 했습니다.
-- 프린스턴에서 물리학을 전공하기 위해 대학에 가야 했습니다. 그래서 저는 드라이클리닝 가게를 시작했습니다. 그리고 실리콘밸리 용어로 말하면, 저는 자금을 모으고, 창립자이자 CEO였으며, 계산원이자 다른 모든 일을 했습니다. 그리고 7년 후에 사업을 정리했습니다. 좋아요, 여러분 정말 친절하시네요. 제 세탁소에 대해 박수를 받아본 적은 없지만, 감사합니다.
-- 그래서 어쨌든 다이애나의 요점, 특히 여러분 모두에게 하고 싶은 말은, 저는 여러분을 보면 너무나 흥분됩니다. 왜냐하면 여러분은 말 그대로 제 나이의 절반, 아니 어쩌면 30% 정도밖에 안 되었는데도 너무나 재능이 있기 때문입니다. 그냥 하세요. 두려워하지 마세요. 아시다시피, 제 경력 전체를 통틀어 물론 세탁소를 운영했지만, 교수로서도 몇 번은 제가 첫 번째 컴퓨터 비전 교수가 되는 학과를 선택했습니다. 그것은 많은 조언에 반하는 것이었습니다. 아시다시피, 젊은 교수라면 커뮤니티와 선배 멘토가 있는 곳으로 가야 합니다. 물론 저는 선배 멘토가 있다면 좋겠지만, 그들이 없다면 저는 여전히 제 길을 개척해야 합니다. 그래서 저는 그것을 두려워하지 않았습니다.
-- 그리고 나서 구글에 가서 구글 클라우드와 B2B 등 사업에 대해 많이 배웠습니다. 그리고 스탠포드 내에서 스타트업을 시작했습니다. 왜냐하면 2018년경에는 AI가 산업을 장악할 뿐만 아니라, AI가 인간의 문제가 되었기 때문입니다. 인류는 항상 기술을 발전시킬 것이지만, 우리는 우리의 인간성을 잃어서는 안 됩니다. 그리고 저는 AI의 진보에 있어서 빛의 등불을 만들고, AI가 어떻게 인간 중심적일 수 있는지, 어떻게 AI를 만들어 인류를 도울 수 있는지 상상하는 것에 대해 정말로 관심을 가지고 있습니다. 그래서 저는 스탠포드로 돌아가 인간 중심 AI 연구소를 설립하고 5년 동안 스타트업처럼 운영했습니다. 아마 어떤 사람들은 제가 대학에서 5년 동안 그것을 스타트업처럼 운영한 것에 대해 그리 좋아하지 않았을 것입니다. 하지만 저는 그것을 매우 자랑스럽게 생각했습니다.
-- 그래서 어떤 면에서는 저는 기업가로 일하는 것을 정말 좋아한다고 생각합니다. 저는 원점에서 시작하는 느낌을 사랑합니다. 과거에 무엇을 했는지, 다른 사람들이 당신을 어떻게 생각하는지는 잊고, 그저 묵묵히 만들고 구축하십시오. 그것이 저의 편안한 영역이며, 저는 그것을 정말 사랑합니다. 당신에 대한 또 다른 정말 멋진 점은, 당신이 해온 모든 놀라운 일들 외에도, 앙드레 카파시, 엔비디아의 짐 팬, 이미지넷의 공동 저자인 자드 뎅과 같은 많은 전설적인 연구자들에게 조언을 해왔다는 것입니다. 그들은 모두 엄청난 경력을 쌓았습니다.
-- 그들이 학생이었을 때 정말 눈에 띄었던 점은 무엇이었나요? 청중들에게 "아, 이 사람은 AI 분야를 바꿀 거야"라고 말할 수 있었던 조언 같은 것이 있다면요? 네, 우선 제가 운이 좋은 사람입니다. 저는 오히려 학생들에게 더 많은 것을 빚지고 있다고 생각합니다. 그들은 정말 저를 더 나은 사람, 더 나은 교사, 더 나은 연구자로 만들어 주었습니다. 그리고 당신이 말씀하셨듯이 많은 전설적인 학생들과 함께 일했던 것은 정말 제 인생의 영광입니다.
-- 그래서 그들은 매우 다릅니다. 어떤 이들은 그저 묵묵히 과학적 문제를 해결하려는 순수한 과학자이고, 어떤 이들은 산업 리더이며, 어떤 이들은 AI 지식을 가장 잘 전파하는 사람입니다. 그러나 저는 그들을 하나로 묶는 한 가지가 있다고 생각하며, 여러분 모두에게 이것에 대해 생각해 보시라고 권하고 싶습니다. 또한 창업자들에게도 말씀드리자면, 이것은 저의 채용 기준이기도 합니다. 저는 지적인 두려움 없음을 찾습니다. 저는 출신이 어디든 상관없다고 생각합니다. 우리가 어떤 문제를 해결하려고 하든 상관없습니다. 어려운 것을 포용하고, 그것을 해결하기 위해 전념하며, 당신이 원하는 어떤 방식으로든 그것을 해결하려는 그 용기와 두려움 없음이 성공하는 사람들의 핵심적인 특징입니다. 저는 이것을 그들로부터 배웠고, 그런 젊은이들을 정말 찾고 있습니다. 그리고 월드 랩스의 CEO로서 채용할 때 그런 자질을 찾습니다.
-- 그래서 월드 랩스에서도 많이 채용하고 있군요? 같은 특성을 찾고 있는 거죠? 네, 다이애나로부터 우리가 채용 중이라고 말해도 좋다는 허락을 받았습니다. 그래서 네, 우리는 많이 채용하고 있습니다. 엔지니어링 인재, 제품 인재, 3D 인재, 생성 모델 인재를 채용하고 있습니다. 그래서 만약 당신이 두려움이 없고 공간 지능 문제를 해결하는 것에 열정적이라면, 저에게 이야기하거나 저희 웹사이트를 방문해 주세요. 좋아요, 다음 10분 동안 질문을 받겠습니다. 안녕하세요, 페이 박사님, 강연 감사합니다. 저는 정말 큰 팬입니다. 음, 제 질문은 20여 년 전에 시각 인식 연구를 하셨는데, 저는 박사 과정을 시작하고 싶습니다. 당신처럼 전설이 되려면 무엇을 연구해야 할까요? 제가 당신에게 사려 깊은 답을 드리고 싶습니다.
-- 항상 당신을 흥분시키는 것을 하라고 말할 수 있기 때문입니다. 그래서 우선 AI 연구는 변했다고 생각합니다. 왜냐하면, 박사 과정을 시작하면 당신은 학계에 있게 되는데, 학계는 더 이상 AI 자원의 대부분을 가지고 있지 않습니다. 제 시대와는 매우 다릅니다. 칩, 컴퓨팅, 데이터는 학계 자원 측면에서 정말 부족하며, 산업계가 훨씬 더 빠르게 해결할 수 있는 문제들이 있습니다. 그래서 박사 과정 학생으로서 저는 산업계가 더 나은 컴퓨팅, 더 나은 데이터, 그리고 팀 과학을 사용하여 더 잘 해결할 수 있는 문제들과 충돌하지 않는 북극성들을 찾으라고 권하고 싶습니다.
-- 그러나 학계에서 여전히 식별할 수 있는 정말 근본적인 문제들이 있습니다. 그것들은 당신이 얼마나 많은 칩을 가지고 있든 상관없이 많은 발전을 이룰 수 있습니다. 음, 우선 저에게 융합 AI는 학계에서 정말 흥미로운 분야입니다. 특히 과학적 발견에 있어서 그렇습니다. AI를 넘나들 수 있는 분야가 너무나 많습니다. 그것은 한 사람이 갈 수 있는 큰 분야라고 생각합니다. 이론적인 측면에서, AI 능력이 이론을 100% 앞질렀다는 것이 저에게는 매력적입니다. 우리는 어떻게 작동하는지 모릅니다. 우리는 설명 가능성이 없습니다. 인과 관계를 알아내는 방법을 모릅니다. 우리가 이해하지 못하는 모델에는 너무나 많은 것이 있어서 계속 발전시킬 수 있습니다.
-- 그리고 컴퓨터 비전에서는 아직 해결하지 못한 표현 문제가 남아 있고, 작은 데이터도 또 다른 정말 흥미로운 영역입니다. 그래서 네, 이것들이 가능성들입니다. 정말 감사합니다, 페이 박사님. 리 교수님, 그리고 예일대에서 명예 박사 학위를 받으신 것을 다시 한번 축하드립니다. 한 달 전 그 순간을 증언하게 되어 영광이었습니다. 제 질문은 교수님의 관점에서 AGI가 단일 통합 모델로 나타날 가능성이 더 높을까요, 아니면 다중 에이전트 시스템으로 나타날 가능성이 더 높을까요? 이 질문을 하신 방식은 이미 두 가지 종류의 정의를 포함합니다. 한 가지 정의는 AGI를 IQ 테스트를 통과하는 것으로 정의하는 더 이론적인 것입니다. 질문의 다른 절반은 훨씬 더 실용적입니다. 에이전트 기반이라면 기능적일까요? 어떤 작업을 할 수 있을까요? 솔직히 AGI의 이 정의에 대해 저는 어려움을 겪습니다. 그 이유는 1956년 다트머스에서 함께 모였던 AI의 창시자들, 존 매카시와 마빈 민스키 같은 분들은 생각할 수 있는 기계의 문제를 해결하고자 했습니다. 그리고 그것은 앨런 튜링도 몇 년 전, 10년인가 그들보다 더 일찍 제시했던 문제였습니다. 그리고 그 진술은 좁은 AI가 아닙니다. 그것은 지능에 대한 진술입니다. 그래서 저는 AI의 그 근본적인 질문과 이 새로운 단어 AGI를 어떻게 구별해야 할지 잘 모르겠습니다. 저에게는 같은 것입니다.
-- 그러나 오늘날 산업계가 AGI를 AI를 넘어선 것처럼 부르는 것을 이해합니다. 그리고 저는 그것에 대해 어려움을 겪습니다. 왜냐하면 AGI가 AI와 정확히 무엇이 다른지 모르기 때문입니다. 만약 우리가 오늘날의 AGI와 유사한 시스템이 80년대, 70년대, 90년대 또는 그 이전의 더 좁은 AI 시스템보다 더 나은 성능을 보인다고 말한다면, 그것은 옳다고 생각합니다. 그것은 단지 분야의 발전일 뿐입니다. 그러나 근본적으로 저는 AI 과학이 지능의 과학이라고 생각합니다. 그것은 인간만큼 또는 인간보다 더 지능적으로 생각하고 행동할 수 있는 기계를 만드는 것입니다. 그래서 저는 AGI를 어떻게 정의해야 할지 모르겠습니다.
-- 그래서 그것을 정의하지 않고서는 그것이 단일체인지 아닌지 모르겠습니다. 뇌를 보면 그것은 한 가지입니다. 단일체라고 부를 수도 있지만, 다른 기능들을 가지고 있으며, 언어를 위한 브로카 영역도 있고, 시각 피질도 있고, 운동 피질도 있습니다. 그래서 저는 그 질문에 어떻게 답해야 할지 정말 모르겠습니다. 안녕하세요, 저는 야슈나입니다. 감사하다는 말씀을 드리고 싶습니다. 이 분야에서 여성이 선도적인 역할을 하는 것을 보는 것이 정말 고무적이라고 생각합니다. 그리고 연구자, 교육자, 기업가로서 AI의 급격한 성장 속에서 어떤 유형의 사람이 대학원에 진학해야 한다고 생각하시는지 묻고 싶었습니다. 그것은 훌륭한 질문이고, 부모님들도 저에게 묻는 질문입니다. 저는 대학원이 불타는 호기심을 가지고 있는 4년 또는 5년이라고 생각합니다. 당신은 호기심에 이끌리고, 그 호기심이 너무 강해서 다른 더 나은 곳에서 할 수 있는 일이 없을 정도입니다.
-- 스타트업과는 다릅니다. 왜냐하면 스타트업은 단순히 호기심에 이끌려서만은 안 됩니다. 좀 조심해야 합니다. 스타트업은 단순히 호기심에만 이끌릴 수 없습니다. 투자자들이 당신에게 화를 낼 것입니다. 음, 스타트업은 더 집중된 상업적 목표를 가지고 있고, 일부는 호기심이지만, 그것만이 아닙니다.
-- 호기심일 뿐입니다. 반면에 대학원생의 경우 문제를 해결하거나 올바른 질문을 하는 그 호기심이 너무 중요해서, 저는 그 강렬한 호기심을 가지고 진학하는 사람들은 외부 세계가 빛의 속도로 지나가더라도 4년 또는 5년을 정말 즐길 것이라고 생각합니다. 왜냐하면 당신은 그 호기심을 따라가고 있기 때문입니다.
-- 우선, 저희에게 시간을 내어주시고 강연해 주셔서 감사합니다. 이미지넷의 성장에 오픈 소스가 큰 부분을 차지했다고 말씀하셨습니다. 그리고 이제 대규모 언어 모델의 최근 출시와 성장으로 인해, 우리는 일부 조직은 완전히 폐쇄형 소스를 유지하고, 일부는 전체 연구 스택을 완전히 공개하며, 일부는 중간 지점에서 가중치를 오픈 소스화하거나 제한적인 라이선스를 사용하는 등 오픈 소스에 대한 다양한 접근 방식을 취하는 것을 보았습니다.
-- 그래서 이러한 오픈 소스에 대한 다양한 접근 방식에 대해 어떻게 생각하시는지, 그리고 AI 회사로서 오픈 소스를 다루는 올바른 방법은 무엇이라고 생각하시는지 묻고 싶었습니다. 저는 다양한 접근 방식이 있을 때 생태계가 건강하다고 생각합니다. 저는 반드시 오픈 소스해야 한다거나 반드시 폐쇄형 소스해야 한다고 종교적으로 생각하지 않습니다. 그것은 회사의 사업 전략에 달려 있습니다.
-- 그리고 예를 들어, 페이스북 메타가 왜 오픈 소스하기를 원하는지는 분명합니다. 그들은 현재 모델 판매로 수익을 내는 것이 아니라, 사람들이 자신들의 플랫폼으로 오도록 생태계를 성장시키기 위해 그것을 사용하고 있습니다. 그래서 오픈 소스는 매우 합리적입니다. 반면에 수익을 창출하는 또 다른 회사는 오픈 소스 계층과 폐쇄형 소스 계층을 고려할 수도 있습니다. 그래서 저는 그 범주나 메타 수준에 대해 매우 열린 생각입니다. 저는 오픈 소스가 보호되어야 한다고 생각합니다. 저는 공공 부문(학계와 같은)과 민간 부문 모두에서 오픈 소스 노력이 있다면 그것은 매우 중요하다고 생각합니다. 그것은 기업가적 생태계에 매우 중요합니다. 그것은 공공 부문에 너무 중요해서 기술적으로 보호되어야 한다고 생각합니다. 불이익을 받아서는 안 됩니다. 안녕하세요, 저는 에스토니아에서 온 칼입니다. 데이터에 대한 질문이 있습니다. 당신은 머신러닝이 데이터 기반 방법으로 전환된 것을 아주 잘 표현했습니다.
-- 이미지넷과 함께 데이터 기반 방법으로 전환된 것을 아주 잘 표현했습니다. 이제 월드 모델 작업을 하고 계신데, 인터넷에 이러한 공간 데이터가 없고 우리 머리 속에만 존재한다고 말씀하셨습니다. 이 문제를 어떻게 해결하고 계신가요? 무엇에 걸고 계신가요? 실제 세계에서 데이터를 수집하고 계신가요? 아니면 합성 데이터를 만들고 계신가요? 그것을 믿으시나요, 아니면 좋은 오래된 사전 지식을 믿으시나요? 감사합니다. 월드 랩스에 오시면 제가 말씀드리겠습니다. 오, 좋은 질문입니다. 음, 회사로서 많은 것을 공유할 수는 없겠지만, 우리가 하이브리드 접근 방식을 취하고 있다는 것을 인정하는 것이 중요하다고 생각합니다. 많은 데이터뿐만 아니라 많은 양질의 데이터를 갖는 것이 정말 중요합니다. 결국 데이터 품질에 주의하지 않으면 쓰레기를 넣으면 쓰레기가 나옵니다.
-- 그래서 마지막 질문 하나만 더 하겠습니다. 안녕하세요, 리 박사님. 저는 애니입니다. 저희와 말씀해 주셔서 정말 감사합니다. 음, 박사님의 책 '내가 보는 세상'에서 이민자 소녀이자 STEM 분야 여성으로서 직면했던 어려움에 대해 이야기하셨습니다. 직장에서 소수자라고 느꼈던 순간이 있었는지 궁금합니다. 만약 그렇다면, 어떻게 그것을 극복하거나 다른 사람들을 설득하셨나요? 그 질문에 감사드립니다. 매우 신중하고 사려 깊게 답변하고 싶습니다. 왜냐하면 우리는 모두 다른 배경을 가지고 있고, 각자가 느끼는 방식은 매우 독특하기 때문입니다. 큰 범주가 무엇이든 거의 상관없습니다. 우리 모두는 자신이 소수자이거나 방에 혼자라고 느끼는 순간을 가집니다. 그래서 물론 저도 그렇게 느꼈습니다. 때로는 제 자신 때문이고, 때로는 제 아이디어 때문이며, 때로는 제 셔츠 색깔 때문이거나, 무엇이든 상관없습니다. 음, 저는 그렇습니다.
-- 그러나 여기서 제가 모든 사람에게 격려하고 싶은 것은 이 나라에 어렸을 때 와서 이미 경험했기 때문에, 그것이 무엇이든 간에 그것에 지나치게 집착하지 않는 능력을 거의 개발했다는 것입니다. 저는 여러분 모두와 마찬가지로 배우거나 일을 하거나 무언가를 창조하기 위해 여기에 있습니다. 감사합니다. 정말 훌륭한 답변이었습니다. 그리고 여러분 모두는 무언가를 시작하거나 시작하는 도중에 있을 것이고, 나약함이나 이상함의 순간을 겪을 것입니다. 저는 매일 이것을 느낍니다. 특히 스타트업 생활에서 말이죠. 때로는 "오 마이 갓, 내가 뭘 하고 있는지 모르겠어"라고 생각합니다. 그저 그것을 하는 데 집중하세요. 최적화된 해결책으로 경사하강법을 사용하세요. 네, 좋습니다. 그것은 멋진 마무리입니다. 리 박사님 감사합니다.
---
-- 감사합니다.