https://youtu.be/c3b-JASoPi0?si=9bXvf2qeGsBhVGtN
Making AI accessible with Andrej Karpathy and Stephanie Zhan
Andrej Karpathy, founding member of OpenAI and former Sr. Director of AI at Tesla, speaks with Stephanie Zhan at Sequoia Capital's AI Ascent about the import...
www.youtube.com
- - 다음이자 마지막 연사인 안드레이 카파시를 소개하게 되어 기쁩니다. 대부분의 사람들이 아마 그의 유튜브 영상을 오랫동안 시청했을 것입니다. 그는 딥러닝 연구로 명성이 높습니다. 스탠포드에서 최초의 딥러닝 수업을 설계했고, 오픈AI의 창립팀의 일원이었으며, 테슬라에서 컴퓨터 비전 팀을 이끌었고, 이제 막 오픈AI를 떠나 다시 미지의 인물이 되었습니다. 그래서 오늘 이 자리에 모시게 되어 매우 행운입니다.
- - 카파시는 별다른 소개가 필요 없겠지만, 오늘날까지 그의 여정에 대한 약간의 배경 설명을 드리고자 합니다. 소냐가 소개했듯이, 그는 제프 힌턴과 페이 리에게서 훈련을 받았습니다. 그의 첫 번째 명성은 스탠포드에서의 딥러닝 강좌였습니다.
- - 그는 2015년에 오픈AI를 공동 설립했고, 2017년에는 일론 머스크에게 스카우트되었습니다. 저는 이 일을 아주 또렷이 기억합니다. 당시 상황을 기억하지 못하는 분들을 위해 설명하자면, 일론 머스크는 당시 6개월마다 바뀌는 여섯 명의 오토파일럿 리더를 거쳐왔습니다. 안드레이가 이 직책을 맡았을 때, 저는 '축하하고 행운을 빈다'고 생각했습니다. 그 후 얼마 지나지 않아 그는 다시 오픈AI로 돌아갔고 지난 한 해 동안 그곳에 있었습니다. 이제 오늘날의 우리 모두와는 달리, 그는 모든 시간과 책임으로부터 완전히 자유로운 궁극적인 영광을 누리고 있습니다. 그래서 오늘 그가 공유할 내용이 정말 기대됩니다. 제가 안드레이에게 가장 감사하게 생각하는 몇 가지는 그가 놀랍도록 매력적인 미래학자이자 사상가라는 점입니다. 그는 끊임없는 낙관주의자이며 매우 실용적인 건설자입니다. 그래서 오늘 그가 이에 대한 통찰력을 공유해줄 것이라고 생각합니다. 시작하자면, 7년 전만 해도 AGI는 우리 평생 동안 달성하기에 불가능에 가까운 것처럼 보였습니다. 이제는 시야에 들어온 것 같습니다. 향후 몇 년 동안의 미래에 대한 당신의 견해는 어떻습니까?
- - 네, 저는 당신의 말이 옳다고 생각합니다. 몇 년 전만 해도 AGI가 어떻게 현실이 될지 불분명했고, 매우 학술적이었으며, 다양한 접근 방식을 생각해야 했습니다. 그러나 이제는 매우 명확해졌고, 많은 공간이 생겼으며, 모든 사람이 그 공간을 채우려 노력하고 있습니다. 그래서 많은 최적화가 이루어지고 있습니다.
- - 그리고 대체로 상황이 전개되는 방식은 모든 사람이 제가 일종의 LLM OS라고 부르는 것을 구축하려 노력하고 있다는 것입니다. 기본적으로 저는 이것을 운영 체제라고 생각하고 싶습니다. 이 새로운 CPU 같은 것에 텍스트, 이미지, 오디오 등 모든 양식과 같은 주변 장치들을 연결해야 합니다. 그리고 LLM 트랜스포머 자체가 CPU이며, 우리가 이미 구축해 놓은 모든 소프트웨어 1.0 인프라와도 연결되어 있습니다.
- - 그래서 모든 사람이 이런 종류의 것을 구축하려 노력하고 있으며, 그것을 경제의 모든 구석구석에 맞게 맞춤 설정할 수 있도록 제공하려고 합니다. 그래서 이것이 대체로 모든 사람이 구축하려 노력하고 있는 것이고, 오늘 일찍이 우리가 들었던 내용이기도 합니다. 그래서 대략적인 방향은 우리가 이러한 상대적으로 독립적인 에이전트들을 만들고 없앨 수 있으며, 이들에게 고수준 작업을 부여하고 다양한 방식으로 특화시킬 수 있다는 것입니다.
- - 그래서 네, 매우 흥미롭고 신나는 일이 될 것이라고 생각합니다. 그리고 그것은 단 하나의 에이전트가 아니라 여러 에이전트입니다. 그렇다면 그것은 어떤 모습일까요? 그리고 미래에 대한 이러한 견해가 사실이라면 우리는 모두 어떻게 다르게 살아야 할까요?
- - 저는 모르겠습니다. 우리는 그것을 만들고, 영향을 미치고, 그것이 선하게 작동하도록 확인해야 할 것 같습니다. 그리고 그냥 잘 되도록 노력해야 합니다. 그래서 이제 당신이 자유롭고 독립적인 에이전트가 되었으니, 오픈AI라는 거대한 존재에 대해 이야기하고 싶습니다.
- - 오픈AI는 현재 생태계를 지배하고 있으며, 오늘 이 자리에 참석한 대부분의 청중은 오픈AI가 하룻밤 사이에 그들을 제거하지 않기를 바라며 작은 틈새시장을 개척하려 노력하는 창업자들입니다. 오픈AI의 야망이 커지는 상황에서도 다른 플레이어들이 새로운 독립적인 회사를 만들 수 있는 기회는 어디에 있다고 생각하시며, 오픈AI가 계속 지배할 영역은 어디라고 생각하십니까?
- - 네, 제 고수준적인 인상은 기본적으로 오픈AI가 이 LLM OS를 구축하려 노력하고 있다는 것입니다. 그리고 오늘 일찍이 들었듯이, 이 플랫폼 위에서 다양한 회사와 다양한 분야를 포지셔닝할 수 있도록 개발하려 노력하고 있습니다. 운영 체제 비유는 정말 흥미롭습니다. 윈도우와 같은 운영 체제를 보면, 기본 앱 몇 가지가 함께 제공됩니다. 예를 들어, 윈도우에는 브라우저가 함께 제공되죠. 엣지 브라우저를 사용할 수 있습니다. 그래서 같은 방식으로 오픈AI나 다른 회사들도 기본 앱 몇 가지를 제공할 수 있겠지만, 그렇다고 해서 그 위에서 다른 브라우저를 실행할 수 없다는 의미는 아닙니다. 마치 그 인프라 위에서 다양한 채팅 에이전트를 실행할 수 있는 것과 같습니다.
- - 그래서 몇 가지 기본 앱은 있겠지만, 경제의 모든 구석구석에 맞게 미세 조정된 모든 종류의 앱들로 이루어진 활기찬 생태계가 잠재적으로 존재할 것입니다. 저는 초기 아이폰 앱들이 어떤 모습이었는지, 농담 같은 것들이 많았고 발전하는 데 시간이 걸렸던 비유를 정말 좋아합니다. 그리고 지금 우리가 정확히 같은 과정을 겪고 있다는 것에 전적으로 동의합니다. 사람들은 이것이 무엇에 능하고 무엇에 능하지 않은지, 어떻게 작동시키고, 어떻게 프로그래밍하고, 어떻게 디버깅하고, 어떻게 실제로 실제 작업을 수행하게 할지 알아내려 노력하고 있습니다.
- - 그리고 그것이 상당히 자율적이지만 완전히 자율적이지는 않으므로 어떤 종류의 감독이 필요할까요? 평가는 어떤 모습일까요? 생각해야 할 것이 많고, 그 심리를 이해하는 것만 해도 시간이 걸릴 것입니다. 그래서 앞으로 몇 년 동안 이 인프라와 정확히 어떻게 작업해야 할지 알아내는 데 시간이 걸릴 것이라고 생각합니다. 그래서 LLM 분야에서는 현재 경쟁이 치열합니다. 오픈AI, 앤트로픽, 미스트랄, 라마, 제미니, 오픈소스 모델 전체 생태계, 그리고 소규모 모델들의 긴 꼬리까지 있습니다. 이러한 생태계의 미래는 어떻게 전개될 것이라고 예측하십니까?
- - 네, 다시 한번 운영 체제 비유가 흥미롭습니다. 예를 들어 윈도우, 맥OS 등 몇몇 독점 시스템의 과점 체제가 있고, 그 외에 리눅스도 있습니다. 리눅스에는 무한히 많은 배포판이 있습니다. 그래서 아마 그런 모습일 것이라고 생각합니다. 또한, 우리가 명칭에 주의해야 한다고 생각합니다. 라마, 미스트랄 등 당신이 나열한 많은 모델들은 실제로는 오픈소스라고 할 수 없습니다. 운영 체제의 바이너리를 넘겨주는 것과 비슷합니다. 그것으로 어느 정도 작업할 수는 있고 유용하지만, 완전히 유용하지는 않습니다.
- - 그리고 완전한 오픈소스 LLM이라고 할 수 있는 것들이 몇 가지 있습니다. 예를 들어 피아 모델, LLM 360, 알모 등이 있습니다. 이들은 데이터를 수집하고 모델을 훈련하는 데 필요한 전체 인프라, 즉 운영 체제를 컴파일하는 데 필요한 모든 것을 완전히 공개하고 있습니다. 그래서 바이너리만 주어졌을 때는 물론 훨씬 좋지만, 모델을 미세 조정할 수는 있어도 완전히 미세 조정할 수는 없습니다. 왜냐하면 모델을 많이 미세 조정할수록 다른 모든 것에 대한 성능이 저하되기 시작하기 때문입니다. 그래서 예를 들어 기능을 추가하고 싶지만 다른 기능을 저하시키고 싶지 않다면, 이전 데이터셋 분포와 새로운 데이터셋 분포를 혼합하여 훈련해야 할 수도 있습니다. 이전 분포를 저하시키고 싶지 않고 지식을 추가하고 싶을 뿐이니까요. 그리고 가중치만 주어지면 그렇게 할 수 없습니다. 실제로는 훈련 루프, 데이터셋 등이 필요합니다. 따라서 이러한 모델들과 작업하는 방식에 제약이 따릅니다.
- - 다시 말하지만, 분명 도움이 되지만 약간 더 나은 용어가 필요하다고 생각합니다. 오픈 웨이트 모델, 오픈소스 모델, 그리고 독점 모델이 있을 수 있습니다. 그리고 아마도 오늘날 우리가 가진 것과 매우 유사한 생태계가 될 것이라고 생각합니다. 그리고 당신이 계속해서 그러한 것들을 구축하는 데 도움을 주시기를 바랍니다. 그래서 다른 큰 문제인 규모에 대해 이야기하고 싶습니다.
- - 단순하게 생각하면 데이터 규모, 컴퓨팅 규모 등 규모가 전부인 것처럼 보이고, 따라서 대규모 연구소와 대형 기술 기업들이 오늘날 엄청난 이점을 가지고 있습니다. 이에 대한 당신의 견해는 어떻습니까? 규모가 전부입니까? 그렇지 않다면 무엇이 더 중요합니까?
- - 저는 규모가 단연코 첫 번째라고 말하고 싶습니다. 물론 세부 사항을 제대로 파악해야 한다고 생각합니다. 그리고 데이터셋 준비 등 많은 노력이 들어가야 하며, 그것을 매우 좋고 깨끗하게 만드는 것이 중요하다고 생각합니다. 이는 모두 컴퓨팅 효율성 향상으로 이어질 수 있습니다. 그래서 데이터, 알고리즘, 그리고 물론 모델 훈련 및 대규모화가 중요합니다. 그래서 규모가 확실히 가장 중요한 결정 요인이자 가장 핵심적인 요소가 될 것이라고 생각합니다. 그러나 올바르게 처리해야 할 다른 많은 것들이 있습니다. 마치 규모가 일종의 속도 제한을 설정하는 것과 같습니다. 그러나 다른 것들도 필요합니다. 그러나 규모가 없다면 근본적으로 이러한 대규모 모델 중 일부를 훈련할 수 없습니다.
- - 만약 모델을 훈련할 계획이라면, 미세 조정 등을 할 계획이라면 아마 더 적은 규모가 필요할 수도 있습니다. 그러나 아직 완전히 그렇게 전개되는 것을 보지는 못했습니다. 그리고 규모 외에 중요하다고 생각하는 다른 요소들에 대해 더 자세히 설명해 주실 수 있습니까? 우선순위는 낮을 수도 있지만요.
- - 네, 첫 번째로 제가 생각하는 것은, 단순히 돈과 규모가 있다고 해서 이러한 모델을 훈련할 수 없다는 것입니다. 이러한 모델을 구축하는 것은 여전히 정말 어렵습니다. 그 이유는 인프라가 아직 너무 새롭고 계속 개발 중이기 때문입니다.
- - 아직 완전히 갖춰지지 않았지만, 이러한 모델을 대규모로 훈련하는 것은 극도로 어렵고 매우 복잡한 분산 최적화 문제입니다. 그리고 실제로 이에 대한 인재가 현재 상당히 부족합니다. 그리고 기본적으로 수만 개의 GPU가 무작위로 다른 시점에 실패하는 상황에서 돌아가는 미친 일이 됩니다. 그래서 그것을 계측하고 작동시키는 것은 실제로는 극도로 어려운 과제입니다. GPU는 최근까지 수만 개의 GPU 워크로드를 위해 의도된 것이 아니었습니다. 그래서 많은 인프라가 그러한 압력 아래에서 삐걱거리고 있으며, 우리는 그것을 해결해야 한다고 생각합니다. 그러나 지금 누군가에게 엄청난 돈이나 엄청난 규모의 GPU를 준다고 해서 그들이 이러한 모델 중 하나를 단순히 생산할 수 있을지는 저에게는 명확하지 않습니다. 이것이 바로 규모만이 전부가 아닌 이유입니다. 인프라, 알고리즘, 데이터 측면 모두에서 엄청난 전문 지식이 필요하며, 그것에 신중해야 합니다. 그래서 저는 이러한 요소들이 주요 구성 요소라고 생각합니다. 생태계가 너무나 빠르게 변화하고 있습니다. 1년 전 존재한다고 생각했던 일부 문제들도 오늘날에는 더 많이 해결되고 있습니다. 환각 현상, 컨텍스트 창, 다중 모드 기능, 추론이 더 빠르고 저렴하게 개선되고 있습니다. 오늘날 LLM 연구의 어떤 문제들이 당신을 밤새 고민하게 합니까? 해결 가능성이 있으면서도 충분히 어려운 문제들이 무엇이라고 생각하십니까?
- - 저는 알고리즘 측면에서 제가 상당히 많이 생각하는 한 가지는 확산 모델과 자동 회귀 모델 사이의 뚜렷한 분할입니다. 둘 다 확률 분포를 나타내는 방식이며, 단순히 다른 양식이 둘 중 하나에 적합한 것으로 나타납니다. 저는 아마도 이들을 통합하거나 어떤 방식으로든 연결할 수 있는 여지가 있다고 생각합니다. 그리고 둘 다의 장점을 얻거나 하이브리드 아키텍처를 어떻게 얻을 수 있는지 알아낼 수 있을 것입니다. 그래서 모델 공간에 두 개의 별개의 스포트라이트가 있고 둘 다 극도로 좋다는 것이 저에게는 이상하게 느껴지고, 그 사이에 아무것도 없다는 것이 잘못된 것 같습니다. 그래서 우리는 그러한 것이 해결되는 것을 보게 될 것이며, 그곳에 흥미로운 문제들이 있다고 생각합니다. 그리고 제가 지적하고 싶은 다른 한 가지는 이 모든 것을 실행하는 데 드는 에너지 효율성 측면에서 여전히 엄청난 격차가 있다는 것입니다. 제 뇌는 대략 20와트입니다. 젠슨 황은 GTC에서 그들이 구축할 대규모 슈퍼컴퓨터에 대해 이야기했습니다. 그 수치는 메가와트 단위입니다. 그래서 뇌를 작동시키는 데 그렇게 많은 것이 필요하지 않을 수도 있습니다. 정확히 얼마가 필요한지는 모르겠지만, 우리는 아마도 이러한 모델을 실행하는 효율성 측면에서 천 배에서 백만 배 정도 차이가 난다고 말할 수 있을 것입니다.
- - 그리고 그 이유 중 일부는 우리가 설계한 컴퓨터가 이러한 워크로드에 잘 맞지 않기 때문입니다. 그리고 저는 엔비디아 GPU가 그 방향으로 좋은 단계라고 생각합니다. 극도로 높은 병렬 처리가 필요하기 때문입니다. 우리는 어떤 방식으로든 데이터에 의존하는 순차적 계산에 대해서는 실제로 신경 쓰지 않습니다. 우리는 그저 많은 다른 배열 요소에 걸쳐 동일한 알고리즘을 실행해야 합니다. 그렇게 생각할 수 있습니다.
- - 그래서 저는 첫 번째로 컴퓨터 아키텍처를 새로운 데이터 워크플로우에 맞게 조정하는 것이라고 말하고 싶습니다. 두 번째는 현재 개선되고 있는 몇 가지 사항을 추진하는 것입니다. 그래서 첫 번째는 아마도 정밀도일 것입니다. 우리는 정밀도가 원래 64비트 더블에서 지금은 읽는 논문에 따라 4, 5, 6 또는 심지어 1.5, 8비트까지 낮아지는 것을 보고 있습니다. 그래서 정밀도는 이것을 다루는 데 큰 지렛대 중 하나라고 생각합니다. 그리고 물론 두 번째는 희소성입니다. 그것 또한 큰 차이점입니다.
- - 저는 당신의 뇌가 항상 완전히 활성화되어 있지는 않다고 말하고 싶습니다. 그래서 희소성이 또 다른 큰 지렛대라고 생각합니다. 그러나 마지막 지렛대로는 저는 컴퓨터와 그 구축 방식에 대한 폰 노이만 아키텍처 자체가 망가졌다고 느낍니다. 메모리와 모든 계산을 수행하는 코어 사이에서 데이터를 왔다 갔다 하며 엄청난 양의 데이터 이동을 합니다. 이것은 당신의 뇌가 작동하는 방식이 아니며, 이것이 당신의 뇌가 매우 효율적인 이유입니다. 그래서 컴퓨터 아키텍처에서 매우 흥미로운 시기가 될 것이라고 생각합니다. 저는 컴퓨터 아키텍트가 아니지만, 우리는 천 배에서 백만 배 정도 차이가 나는 것 같고, 그것을 줄일 정말 흥미로운 혁신이 있을 것이라고 생각합니다.
- - 아마 청중에는 이 문제에 대해 작업하고 있는 몇몇 건설자들이 있을 것입니다. 좋습니다. 잠시 화제를 바꿔서, 당신은 우리 세대의 많은 위대한 인물들과 함께 일했습니다. 샘 알트만, 그렉 브록만, 그리고 다른 오픈AI 팀원들, 일론 머스크 등입니다. 여기 계신 분들 중에 미국 팀과 일본 팀의 노 젓기 농담을 아는 분이 있습니까? 좋습니다. 그럼 이것은 좋은 농담이 될 것입니다. 일론 머스크는 알스 베이스캠프에서 이 농담을 공유했는데, 저는 이것이 그가 문화와 팀을 구축하는 방식에 대한 그의 철학을 많이 반영한다고 생각합니다. 두 팀이 있습니다. 일본 팀은 네 명의 노 젓는 사람과 한 명의 키잡이가 있습니다. 미국 팀은 네 명의 키잡이와 한 명의 노 젓는 사람이 있습니다. 미국 팀이 졌을 때 무엇을 할지 짐작할 수 있는 분 있습니까? 맞습니다. 그들은 노 젓는 사람을 해고합니다. 일론 머스크는 이 예를 들면서 적절한 사람을 고용하고, 적절한 비율로 적절한 팀을 구축하는 방식에 대해 어떻게 생각하는지 보여주었다고 생각합니다.
- - 이러한 놀라운 리더들과 매우 긴밀하게 일하면서 무엇을 배웠습니까?
- - 네, 저는 일론 머스크가 정말 독특한 스타일로 회사를 운영한다고 단언할 수 있습니다. 사람들이 그것이 얼마나 독특한지 제대로 이해하지 못한다고 생각합니다. 당신은 책에서 그것에 대해 읽을 수도 있지만, 실제로 이해하지 못할 것입니다. 그것은 설명하기조차 어렵습니다. 어디서부터 시작해야 할지 모르겠습니다. 그러나 그것은 매우 독특하고 다른 방식입니다. 저는 그가 가장 큰 스타트업을 운영한다고 말하고 싶습니다. 그리고 그것은 그냥 음, 어디서부터 설명해야 할지 모르겠습니다. 마치 더 긴 시간 동안 생각해야 할 것 같은 일입니다. 그러나 첫 번째는 그가 매우 작고 강하며 고도로 기술적인 팀을 좋아한다는 것입니다. 이것이 첫 번째입니다. 저는 일반적으로 회사에서 팀이 성장하고 커진다고 말하고 싶습니다. 일론 머스크는 항상 성장에 반대하는 세력이었습니다. 저는 사람들을 고용하기 위해 노력하고 힘을 써야 했고, 사람들을 고용하기 위해 기본적으로 간청해야 했습니다.
- - 그리고 다른 한 가지는 대기업에서는 일반적으로 실적이 낮은 직원을 해고하기가 정말 어렵다는 것입니다. 그런데 일론 머스크는 기본적으로 실적이 낮은 직원을 해고하는 데 매우 적극적입니다. 그래서 저는 팀원들을 지키기 위해 싸워야 했습니다. 그는 기본적으로 사람들을 해고하고 싶어 했으니까요. 그래서 이것이 한 가지입니다. 작고 강하며 고도로 기술적인 팀을 유지하는 것, 비기술적인 중간 관리자가 없는 것, 이것이 첫 번째입니다. 두 번째는 모든 것이 돌아가는 분위기입니다. 그가 사무실에 들어설 때 느껴지는 분위기입니다.
- - 그는 활기찬 공간을 원합니다. 사람들이 돌아다니고, 왔다 갔다 하고, 흥미로운 일에 몰두하고, 무언가를 차트화하고, 코딩하는 모습을 원합니다. 그는 정체를 싫어하고, 그렇게 보이는 것을 싫어합니다. 그는 대규모 회의를 싫어하며, 항상 사람들에게 유용하지 않은 회의에서는 나가라고 격려합니다. 그래서 실제로 이런 일이 일어납니다. 대규모 회의에서 기여하지 않고 배우는 것이 없다면 그냥 나가는 것입니다. 이것은 전적으로 권장됩니다. 이런 모습은 보통 볼 수 없습니다. 그래서 저는 분위기가 그가 문화적으로 정말 주입하는 두 번째 큰 지렛대라고 생각합니다. 아마 그 일부분은 많은 대기업들이 직원을 지나치게 비위를 맞춘다는 점일 것입니다. 그런 것이 훨씬 적습니다. 그 문화는 최고의 기술적인 작업을 수행하기 위해 그곳에 있다는 것이고, 강도와 집중도가 있습니다. 그리고 아마도 매우 독특하고 매우 흥미롭고 매우 이상한 마지막 한 가지는 그가 팀과 얼마나 연결되어 있는지입니다. 일반적으로 회사의 CEO는 5단계 위에 있는 원격 인물이며, 그들의 VP에게 이야기하고, 그들의 보고서와 이사들에게 이야기하고, 결국 당신은 당신의 관리자에게 이야기합니다. 그러나 테슬라에서는 그렇지 않습니다. 그는 사무실에 와서 엔지니어들과 직접 이야기합니다.
- - 우리가 가졌던 많은 회의는 일론과 함께 방에 50명이 있었고, 그는 엔지니어들에게 직접 이야기합니다. 그는 VP나 이사들과만 이야기하는 것을 원하지 않습니다. 그래서 저는 일반적으로 사람들이 VP와 이야기하는 데 아마 99%의 시간을 보낼 것이라고 생각하지만, 그는 아마 50%의 시간을 보내고 엔지니어들과 이야기하고 싶어 합니다.
- - 그래서 팀이 작고 강하다면, 엔지니어와 코드가 진실의 원천입니다. 그래서 그들이 진실의 원천이지 관리자가 아닙니다. 그리고 그는 실제 상황과 개선을 위해 무엇을 해야 하는지 이해하기 위해 그들과 이야기하고 싶어 합니다. 그래서 저는 그가 팀과 연결되어 있는 정도가 원격 인물과는 다르다는 점도 독특하다고 말하고 싶습니다. 그리고 또한 그의 큰 망치와 조직 내에서 그것을 휘두르려는 그의 의지도 마찬가지입니다. 그래서 만약 그가 엔지니어들과 이야기하고 그들이 "뭐가 막고 있나요? GPU가 충분하지 않아서 내 일을 실행할 수 없습니다."라고 말하면, 그는 "아, 알겠습니다."라고 말하고, 두 번 들으면 "알겠습니다. 이건 문제입니다. 우리의 일정은 어떻게 되나요? 만족스러운 답변이 없으면 그는 "알겠습니다. GPU 클러스터를 담당하는 사람과 이야기하고 싶습니다."라고 말할 것입니다. 그리고 누군가 전화를 걸면 그는 "좋아, 지금 당장 클러스터를 두 배로 늘려. 내일부터 클러스터가 두 배가 될 때까지 매일 업데이트를 보내."라고 말합니다. 그러면 그들은 반발하며 "음, 우리는 조달 설정이 되어 있고, 일정이 있고, 엔비디아가 GPU가 충분하지 않다고 말했고 6개월이 걸릴 겁니다."라고 말합니다. 그러면 그는 눈썹을 치켜 올리며 "좋아, 젠슨 황과 이야기하고 싶습니다."라고 말하고, 그냥 병목 현상을 제거합니다. 그래서 저는 그가 극도로 관여하고 병목 현상을 제거하며 그의 망치를 휘두르는 정도가 또한 인정받지 못한다고 생각합니다. 그래서 저는 이러한 매우 독특하다고 말할 수 있는 많은 측면들이 있고 매우 흥미롭다고 생각합니다. 솔직히 말해서, 그런 곳 밖의 평범한 회사에 가는 것은, 당신은 확실히 그런 측면들을 그리워할 것입니다. 그래서 저는 네, 아마도 길게 이야기했지만, 모든 요점을 다 다루지는 못했다고 생각합니다. 그러나 그것은 매우 독특한 일이고 매우 흥미롭습니다. 그리고 네, 제 생각입니다. 대부분의 사람들이 활용할 수 있는 전략입니다. 잠시 물러서서, 당신은 우리 세대에서 가장 획기적인 회사들을 구축하는 데 일조했습니다. 또한 오늘날 많은 청중을 포함하여 많은 사람들이 AI 분야에 진입하는 데 핵심적인 조력자가 되었습니다. 당신이 가장 중요하게 생각하는 것이 AI 교육 및 도구에 대한 접근성을 민주화하고, 전체 생태계에서 더 많은 평등을 만들고, 더 많은 승자를 만드는 것이라는 것을 알고 있습니다. 인생의 다음 장을 생각할 때, 무엇이 당신에게 가장 큰 의미를 줍니까?
- - 네, 저는 당신이 그것을 올바르게 설명했다고 생각합니다. 제 뇌가 기본적으로 가는 곳은, 제가 몇몇 회사에서 일했지만, 궁극적으로 저는 특정 회사에 대해 신경 쓰지 않습니다. 저는 생태계에 훨씬 더 많은 관심을 가집니다. 저는 생태계가 건강하고 번성하기를 원합니다. 경제의 모든 구석구석에서 멋지고 흥미로운 스타트업들의 산호초처럼 번성하기를 원합니다. 그리고 전체가 멋진 것들로 끓어오르는 수프 같기를 원합니다. 안드레이는 진정으로 산호초를 꿈꿉니다. 저는 그것이 멋진 곳이 되기를 원합니다. 그리고 저는 네, 그래서 저는 스타트업을 사랑하고 회사를 사랑하며, 그들의 활기찬 생태계가 있기를 원합니다. 그리고 기본적으로 저는 AGI가 힘을 엄청나게 증폭시키는 상황에서 5개의 거대 기업이 모든 것을 장악하는 것에 대해 조금 더 주저하고 있습니다. 그것이 어떤 모습일지 걱정이 됩니다. 그래서 저는 그것에 대해 더 많이 생각해야 합니다. 그러나 네, 저는 생태계를 사랑하고 그것이 건강하고 활기차기를 원합니다. 정말 놀랍습니다. 청중으로부터 몇 가지 질문을 받고 싶습니다. 네, 브라이언 씨. 안녕하세요. 브라이언 할란입니다. 창업자들에게 일론 머스크의 경영 방식을 따르라고 권하시겠습니까? 아니면 그에게만 독특한 방식이라 따라 하지 말아야 할까요?
- - 네, 좋은 질문이라고 생각합니다. 그것은 창업자의 DNA에 달려 있다고 생각합니다. 당신은 그런 종류의 DNA와 그런 종류의 분위기를 가지고 있어야 합니다. 그리고 팀을 고용할 때, 이것이 당신이 운영하는 회사의 종류라는 것을 미리 명확히 하는 것이 정말 중요합니다. 그리고 사람들이 그것에 동의하면 실제로 매우 기뻐하며 따릅니다. 그러나 나중에 바꾸면 사람들이 행복해하지 않을 것이고 매우 혼란스러울 것입니다. 그래서 처음부터 일관되게 한다면 그런 식으로 회사를 운영할 수 있다고 생각합니다.
- - 그리고 음, 그것은 장단점이 있습니다. 그리고 저는 음, 그래서 사람들에게 달려 있지만, 그것은 회사 구축 및 운영의 일관된 모델이라고 생각합니다. 네, 알렉스 씨. 안녕하세요. 모델 구성 가능성 유형 중에서 특히 흥미로운 것이 있는지 궁금합니다. 전문가 혼합(mixture of experts) 외에 모델 병합, 프랑켄 병합 또는 모델 개발을 더 구성 가능하게 만드는 다른 것들에 대해 어떻게 생각하시는지 궁금합니다.
- - 네, 좋은 질문입니다. 이 분야의 논문들은 보지만, 실제로 정착된 것은 없는 것 같습니다. 구성 가능성이라는 것이 무엇을 의미하는지 정확히 모르겠지만, 매개변수 효율적인 훈련 등 많은 연구가 진행되고 있습니다. 제 생각에 그것을 구성 가능성 범주에 넣을지는 모르겠습니다. 그러나 전통적인 코드가 매우 구성 가능하지만, 신경망은 훨씬 더 완전히 연결되어 있고 기본적으로 덜 구성 가능합니다. 그러나 그것들은 전체의 일부로 구성되고 미세 조정됩니다. 예를 들어, 챗GPT와 이미지 등을 포함하는 시스템을 만들고 싶다면, 구성 요소를 사전 훈련한 다음 플러그인하고 전체를 미세 조정하는 것이 매우 일반적입니다. 그래서 피질의 작은 조각들을 외부에서 사전 훈련하고 나중에 구성하는 측면에서 구성 가능성이 있습니다.
- - 그래서 초기화와 미세 조정을 통해서입니다. 그래서 어느 정도는 그렇습니다. 아마도 이것이 제 두서없는 생각일 뿐이지만, 다른 일관된 의견은 없는 것 같습니다. 네, 닉 씨.
- - 음, 우리는 다음 단어 예측 모델을 가지고 있습니다. 물리적 모델을 가지고 있고 자기 일관적이며 물리학자의 새로운 아이디어를 생성할 수 있는 물리학자나 폰 노이만 유형의 모델을 구축할 수 있는 길이 있다고 생각하십니까? 핵융합을 어떻게 하죠? 어떻게 광속보다 빠르게 갈 수 있죠? 만약 가능하다면요. 그런 길이 있나요? 아니면 이러한 AI 모델 개발 측면에서 근본적으로 다른 벡터인가요?
- - 저는 한 가지 측면에서 근본적으로 다르다고 생각합니다. 당신이 말하는 것은 아마도 능력 문제입니다. 현재 모델은 충분히 좋지 않고, 여기에는 해결해야 할 큰 문제들이 있다고 생각합니다. 그리고 사람들은 이 분야에서 가능한 것이 무엇인지 아직 제대로 보지 못했다고 생각합니다. 대체로 우리는 알파고의 1단계, 즉 모방 학습 부분을 완료했다고 생각합니다. 알파고의 2단계는 강화 학습(RL)인데, 사람들은 아직 이것을 하지 않았습니다. 그리고 저는 이것이 근본적으로 작동하게 만들고 초인적인 것을 만든 부분이라고 생각합니다.
- - 그래서 저는 아직 해결해야 할 큰 능력 문제들이 있다고 생각합니다. 그리고 그 세부 사항은 까다로울 수 있지만, 간단히 말해서 우리는 알파고의 2단계는 아직 하지 않았고, 모방 학습만 했습니다. 그리고 사람들은 예를 들어 GPT와 같은 것들을 위한 데이터 수집이 얼마나 엉망인지 제대로 이해하지 못한다고 생각합니다. 예를 들어, 어떤 프롬프트가 수학 문제라고 가정해 봅시다. 인간이 와서 그 문제에 대한 이상적인 해결책을 제시합니다. 문제는 인간의 심리가 모델의 심리와 다르다는 것입니다. 인간에게 쉬운 것과 어려운 것은 모델에게 쉬운 것과 어려운 것과 다릅니다. 그래서 인간은 해결책에 이르는 일종의 과정을 채우지만, 그 과정의 일부는 모델에게는 사소한 것이고, 일부는 모델이 이해하지 못하는 엄청난 도약입니다.
- - 그래서 당신은 그것을 잃고, 나중에 다른 모든 것이 오염됩니다. 그래서 근본적으로 필요한 것은 모델이 스스로 이러한 문제를 해결하는 방법을 연습해야 한다는 것입니다. 모델은 무엇이 자신에게 효과가 있고 효과가 없는지 파악해야 합니다. 아마도 네 자리 숫자 덧셈에 능숙하지 않아서 계산기를 사용할 것입니다. 그러나 모델은 자신의 능력과 지식에 따라 스스로 그것을 배워야 합니다. 그래서 이것이 첫 번째입니다. 그것은 완전히 망가졌다고 생각합니다. 에이전트 같은 것에 대한 좋은 초기화 도구이기는 하지만요.
- - 그리고 다른 한 가지는 우리가 인간 피드백으로부터 강화 학습을 하고 있지만, 그것은 매우 약한 형태의 강화 학습이며, 저는 강화 학습이라고도 할 수 없다고 생각합니다. RHf에 대한 알파고의 등가물은 무엇일까요? 보상 모델은 무엇일까요? 저는 그것을 '분위기 확인(vibe check)'이라고 부릅니다. 예를 들어, 알파고 RHf를 훈련하고 싶다고 상상해 보세요. 두 사람에게 두 개의 바둑판을 주고 어느 것을 선호하는지 물은 다음, 그 레이블을 가지고 모델을 훈련하고 그것을 대상으로 강화 학습을 할 것입니다. 여기에는 어떤 문제들이 있을까요? 첫째, 그것은 바둑판의 분위기에 대한 것일 뿐이며, 그것을 대상으로 훈련하는 것입니다. 둘째, 보상 모델이 신경망이라면, 최적화 대상 모델이 그 보상 모델에 과적합하기가 매우 쉽고, 그 거대한 모델을 해킹하는 모든 가짜 방식을 찾아낼 것입니다. 그래서 알파고는 매우 명확한 목적 함수를 가지고 있기 때문에 이러한 문제를 우회합니다. 그것을 대상으로 강화 학습을 할 수 있습니다. RHf는 강화 학습에 비할 바가 못 되며, 저는 강화 학습이 바보 같다고 생각합니다. 다른 한 가지는 모방 학습이 매우 바보 같고, RL HF는 좋은 개선이지만 여전히 바보 같다고 생각합니다. 그리고 사람들은 모델을 훈련하는 더 나은 방법을 찾아야 한다고 생각합니다. 그래서 모델이 스스로와 자신의 심리와 루프 안에 있게 해야 합니다. 그리고 우리는 아마도 그 방향으로 돌파구를 마련할 것이라고 생각합니다. 그래서 그것은 AI 모델을 위한 대학원과 같습니다. 모델은 방에 앉아 책을 읽고 10년 동안 조용히 스스로에게 질문해야 합니다.
- - 네, 그것도 한 부분이라고 생각합니다. 그리고 자료를 배우고 교과서를 볼 때, 교과서에 연습 문제가 있습니다. 그것들은 무엇일까요? 그것들은 자료를 연습하기 위한 당신에게 주어지는 프롬프트입니다. 그리고 당신이 자료를 배울 때, 단순히 왼쪽에서 오른쪽으로 읽는 것이 아니라, 연습도 하지만, 메모를 하고, 다시 말하고, 재구성하는 등 그 지식을 배우는 방식으로 많은 조작을 합니다. 그리고 우리는 LLM에서 그와 동등한 것을 전혀 보지 못했습니다. 그래서 아직 초기 단계라고 생각합니다. 네, 예. 안녕하세요. 최적화되고 동시에 실용적이라는 것은 멋진 일입니다. 그래서 저는 다음과 같은 질문을 드리고 싶습니다. 비용 절감과 수익 창출 또는 더 나은 추론 능력을 가진 더 나은 품질의 모델을 찾는 것 중 우선순위를 어떻게 정렬하시겠습니까?
- - 질문을 이해했다고 생각합니다. 제가 많은 사람들이 하는 것을 보면, 그들은 비용이 얼마든 상관없이 가장 유능한 모델로 시작합니다. 그래서 GPT-4를 사용하고, 슈퍼 프롬프트 등을 사용하고, RAG 등을 사용합니다. 그들은 단지 자신의 것을 작동시키려고 노력합니다. 그래서 그들은 정확성을 먼저 추구하고, 나중에 양보합니다. 특정 유형의 쿼리에 대해 3.5로 돌아갈 수 있는지 확인하고, 나중에 더 저렴하게 만듭니다. 그래서 저는 성능을 먼저 추구하고 나중에 더 저렴하게 만드는 것을 제안하고 싶습니다.
- - 이것은 제가 이 문제에 대해 이야기했던 몇몇 사람들이 효과가 있다고 말하는 패러다임입니다. 그리고 어쩌면 단일 프롬프트 제품조차 아닐 수도 있습니다. 그냥 어떻게든 작동하게 만들 수 있는 방법이 무엇인지 생각해 보세요. 왜냐하면 그냥 어떻게든 작동하게 만들 수 있다면, 예를 들어 10개나 20개의 프롬프트를 만들고 가장 좋은 것을 선택하고 어떤 종류의 논쟁이나 알 수 없는 미친 흐름을 생각해낼 수 있다면 말이죠. 그냥 당신의 것을 정말 잘 작동하게 만드세요. 왜냐하면 정말 잘 작동하는 것이 있다면, 또 다른 할 수 있는 것은 그것을 증류할 수 있다는 것입니다. 그래서 가능한 문제 유형의 대규모 분포를 얻고, 가장 비싼 것을 실행하여 레이블을 얻은 다음, 그것을 대상으로 미세 조정하는 더 작고 저렴한 것을 얻을 수 있습니다. 그래서 저는 항상 비용이 얼마든 상관없이 최대한 잘 작동하게 만드는 것을 먼저 추구하고 나중에 더 저렴하게 만드는 것을 제안합니다.
- - 샘 씨, 안녕하세요. 질문이 있습니다. 작년에 오픈소스 생태계에서 매우 인상적인 결과들이 많이 나왔습니다. 모델이 계속 개선되고 확장됨에 따라 오픈소스가 클로즈드 소스 개발과 어떻게 보조를 맞출 수 있을지, 또는 맞추지 못할지에 대한 당신의 의견이 궁금합니다.
- - 네, 매우 좋은 질문입니다. 저는 근본적으로 이러한 모델들이 엄청난 자본 집약적이라는 것을 정말 모르겠습니다. 예를 들어 페이스북이나 메타 등은 이러한 모델을 대규모로 훈련할 여유가 있지만, 그것은 그들이 하는 일의 일부가 아니고, 그들의 돈벌이와 무관합니다. 그래서 그들은 생태계 전체를 강화하기 위해 이러한 모델 중 일부를 출시할 실제적인 유인을 가지고 있습니다. 그래서 그들은 모든 최고의 아이디어를 빌릴 수 있습니다. 그래서 그것은 저에게는 합리적입니다. 그러나 지금까지 그들은 오픈 웨이트 모델만 출시했을 뿐이라고 말하고 싶습니다. 그래서 저는 그들이 더 나아가야 한다고 생각하고, 그것이 제가 보고 싶은 것입니다. 그리고 그것이 모두에게 더 좋을 것이라고 생각합니다.
- - 그리고 잠재적으로 데이터 등에 대한 일부 측면에 대해 결국 조심스러워할 수도 있습니다. 그것을 어떻게 극복해야 할지 모르겠습니다. 아마 그들은 사용하기 매우 쉬운 데이터 소스를 찾거나 그런 것들에 자신을 제한하려고 노력해야 할 것입니다. 그래서 저는 그러한 것들이 우리의 챔피언이라고 말하고 싶습니다. 잠재적으로 말이죠. 그리고 저는 또한 메타나 페이스북과 같은 곳에서 더 많은 투명성이 있기를 바랍니다. 논문을 발표하고, 일지 등을 발행했으니 잘 하고 있다고 생각합니다. 그러나 생태계를 육성하는 측면에서는 훨씬 더 잘 할 수 있습니다. 아마도 그것이 곧 올 것입니다. 피터 씨. 네, 아마 이전 질문을 고려하면 명백한 답변일 수도 있겠지만, AI 생태계를 더 멋지고 활기차게 만드는 것은 무엇이라고 생각하십니까? 아니면 무엇이 그것을 방해하고 있습니까? 개방성인가요? 아니면 당신이 중요하게 생각하는 다른 것들도 있습니까?
- - 네, 저는 분명히 한 가지 큰 측면은 그냥 사용 가능한 것들이라고 생각합니다. 저는 최근에 "첫째, 물건을 만들고, 둘째, 경사로를 만들어라"라는 트윗을 올렸습니다. 저는 물건을 만드는 사람들이 많다고 생각합니다. 그러나 사람들이 이 모든 것을 실제로 이해하고, 올라설 수 있도록 경사로를 만드는 일은 훨씬 적게 일어나고 있다고 생각합니다. 그리고 저는 우리 모두가 이 모든 것에 익숙하지 않고, 우리 모두가 어떻게 작동하는지 이해하려고 노력하고 있으며, 효과적으로 사용하기 위해 우리 모두가 어느 정도 ramp up하고 협력해야 한다고 생각합니다. 그래서 저는 사람들이 자신들이 배운 것, 이 모든 것을 어떻게 훈련했는지, 무엇이 효과가 있고 무엇이 효과가 없는지 등에 대해 훨씬 더 개방적이기를 바랍니다.
- - 그리고 네, 서로에게서 훨씬 더 많이 배우는 것입니다. 그것이 첫 번째입니다. 그리고 두 번째로 저는 오픈 생태계에도 상당한 모멘텀이 있다고 생각합니다. 그래서 그것은 이미 좋은 일이며, 개선의 여지가 있을 수도 있다고 이미 이야기했습니다. 그래서 네, 청중으로부터 마지막 질문입니다. 마이클 씨.
- - 모델에서 다음의 큰 성능 도약을 이루기 위해 트랜스포머 아키텍처를 예를 들어 사고 토큰이나 활성화 비콘으로 수정하는 것으로 충분할까요? 아니면 완전히 버리고 새로운 근본적인 구성 요소를 생각해내야 다음 큰 단계나 AGI로 나아갈 수 있을까요?
- - 네, 좋은 질문이라고 생각합니다. 첫 번째로 제가 말하고 싶은 것은 트랜스포머는 정말 놀랍고 믿을 수 없다는 것입니다. 저는 확실히 그것이 올 것이라고 예상하지 못했을 것입니다. 트랜스포머가 등장하기 한동안 저는 신경망의 엄청난 다양화가 있을 것이라고 생각했습니다. 그러나 실제로는 완전히 반대였습니다. 실제로는 모두 같은 모델입니다. 그래서 그것을 우리가 가지고 있다는 것이 저에게는 놀랍습니다. 그것이 최종적인 신경망이라고는 생각하지 않습니다. 저는 분명히 큰 변화가 있을 것이라고 생각합니다. 이 분야의 역사를 고려할 때, 제가 오랫동안 이 분야에 있었기 때문에 이것이 끝이라고 말하기는 정말 어렵습니다.
- - 저는 절대 그렇지 않다고 생각합니다. 그리고 저는 누군가가 오늘날 우리가 일을 하는 방식에 꽤 큰 변화를 찾을 수 있을 것이라고 매우 낙관적으로 생각합니다. 자동 회귀 또는 확산 모델의 전선, 즉 모델링 및 법칙 설정 측면에서는 분명히 성과가 있을 것이라고 생각합니다. 그러나 트랜스포머와 제가 언급했던 정밀도와 희소성이라는 지렛대에서도 마찬가지입니다. 그리고 우리가 그것을 추진하고 하드웨어 공동 설계가 어떻게 진화할지와 함께, 그리고 네트워크 아키텍처를 그러한 제약 조건과 모든 작동 방식에 훨씬 더 잘 맞도록 만들면서 말입니다.
- - 음, 어느 정도는 트랜스포머가 GPU를 위해 설계되었다고도 말할 수 있습니다. 그것이 트랜스포머 논문에서 큰 도약이었다고 생각하며, 그들이 시작한 곳도 바로 그곳입니다. 즉, 근본적으로 극도로 병렬화 가능한 아키텍처를 원했다는 것입니다. 왜냐하면 순환 신경망은 순차적인 종속성을 가지고 있어 GPU에 최악이기 때문입니다. 트랜스포머는 어텐션을 통해 기본적으로 그것을 해결했으며, 이것이 주요 통찰력이었습니다. 그리고 신경 GPU 및 구글의 다른 논문들과 같은 통찰력의 선구자들이 있었는데, 그들은 이 문제에 대해 생각하고 있었습니다. 그러나 그것은 사용 가능한 하드웨어에 알고리즘을 타겟팅하는 방법입니다. 그래서 저는 그것이 같은 정신이라고 말하고 싶습니다. 그러나 간단히 말해서, 저는 여전히 변화가 있을 가능성이 매우 높다고 생각하지만, 놀랍도록 탄력적이라는 것이 입증되었습니다. 그것은 몇 년 전에 나왔습니다. 6, 7년 전입니다. 원래 트랜스포머와 오늘날 우리가 사용하는 것은 그렇게 크게 다르지 않습니다.
- - 네, 청중의 모든 창업자 및 빌더들에게 마지막 메시지로서, AI의 미래를 형성하는 데 남은 생을 바치고 있는 그들에게 어떤 조언을 해주시겠습니까?
- - 네, 저는 특별히 엄청나게 일반적인 조언은 가지고 있지 않습니다. 아마도 제 머릿속에 가장 먼저 떠오르는 것은 창업자들이 물론 자신의 스타트업에 대해 많은 관심을 가진다는 것입니다. 저는 또한 어떻게 하면 활기찬 스타트업 생태계를 가질 수 있을지, 특히 대기업과의 경쟁에서 스타트업들이 계속 승리할 수 있을지, 그리고 생태계가 어떻게 더 건강해질 수 있을지에 대해 생각합니다. 투자자가 되어야 할 것 같습니다. 정말 놀랍습니다. 오늘 이 자리와 하루 종일 함께 해주신 안드레이께 정말 감사합니다.
---
- 감사합니다.
다음은 제공된 자료에서 얻은 정보를 바탕으로 한 포괄적인 요약입니다.
**안드레이 카르파티(Andrej Karpathy) 소개 및 배경**
안드레이 카르파티는 딥러닝 연구로 명성이 높으며, 스탠포드 대학교에서 최초의 딥러닝 강좌를 개설했습니다 [1, 2]. 그는 OpenAI의 창립팀의 일원이었고 [1-3], 테슬라에서 컴퓨터 비전 팀을 이끌었으며 [1, 3], 현재는 OpenAI를 떠나 자유로운 상태입니다 [1, 3]. 과거 Sonia는 그를 Jeff Hinton과 Fay의 지도를 받은 인물로 소개했습니다 [2]. Andrej는 놀라운 미래주의적 사상가이자 [3], 끊임없는 낙관주의자이며 [3], 매우 실용적인 개발자로서 평가받고 있습니다 [3].
**OpenAI의 초기 시절**
OpenAI의 원래 사무실은 Sequoia Capital의 샌프란시스코 사무실 건너편에 위치한 '초콜릿 공장' 건물 지하에 있었습니다 [4]. Greg의 아파트 다음으로 사용된 첫 사무실로, 약 2년간 사용되었으며 항상 초콜릿 냄새가 좋았다고 합니다 [4]. 팀은 10~20명 이상 규모였으며 [4], 중요한 일화 중 하나는 Nvidia의 Jensen이 최초의 DGX를 OpenAI에 직접 전달한 일입니다 [2]. 당시 모두가 그 장비에 서명했으며, 이는 최근 GTC에서 Jensen에 의해 언급되기도 했습니다 [2].
**AGI(범용 인공지능)에 대한 관점**
몇 년 전까지만 해도 AGI는 생애 내 달성하기 불가능해 보이는 과제였지만, 이제는 가시권에 들어왔다고 합니다 [5]. Karpathy는 과거에는 AGI가 어떻게 실현될지 불분명하고 학문적이었으나, 지금은 그 경로가 매우 명확하며 모든 사람이 그 공간을 채우기 위해 노력하고 있다고 언급했습니다 [5].
**LLM OS(거대 언어 모델 운영체제) 개념**
Karpathy는 현재 모든 기업이 일종의 'LLM OS'를 구축하려 한다고 설명합니다 [6, 7]. 이는 새로운 CPU(LLM 트랜스포머 자체)에 연결되는 주변 장치(텍스트, 이미지, 오디오 등 모든 모달리티)와 이미 구축된 소프트웨어 1.0 인프라를 포함하는 운영 체제로 비유됩니다 [6]. 이 시스템은 경제의 다양한 틈새시장에 맞게 **사용자 정의 가능**하도록 만들어질 것이며 [8], 고수준의 작업을 부여하고 다양한 방식으로 전문화할 수 있는 **상대적으로 독립적인 에이전트**들을 생성하고 확장하는 방향으로 발전할 것이라고 예측했습니다 [8, 9].
**스타트업을 위한 기회와 OpenAI의 역할**
OpenAI가 생태계를 지배하고 있지만, Karpathy는 스타트업들에게도 많은 기회가 있다고 봅니다 [7]. LLM OS 비유를 들며, Windows와 같은 운영 체제에 기본 앱(예: Edge 브라우저)이 포함되어 있듯이, OpenAI도 몇 가지 '기본 앱'을 제공할 수 있지만 [7]. 이는 다른 브라우저나 다양한 채팅 에이전트가 그 인프라 위에서 실행될 수 없다는 것을 의미하지 않는다고 설명합니다 [7]. 그는 초기 아이폰 앱 생태계를 예로 들며, 처음에는 '농담' 같았던 앱들이 시간이 지나면서 발전했듯이, 현재 LLM 앱 생태계도 비슷한 과정을 겪고 있으며 [10], 모델이 어떤 작업에 능숙하고 능숙하지 않은지, 어떻게 작동하고 프로그래밍하며 디버깅하고 실제 작업을 수행하는지 이해하는 데 시간이 걸릴 것이라고 말했습니다 [10]. 또한, 자율적이지만 완전히 자율적이지 않은 모델에 대한 **감독 및 평가 방법**도 중요한 과제라고 강조했습니다 [11].
**LLM 생태계의 미래**
LLM 경쟁이 치열한 가운데, Karpathy는 LLM 생태계를 운영 체제에 비유했습니다 [11, 12]. Windows나 Mac OS와 같은 **독점 시스템의 과점**과 함께, **Linux와 같은 오픈 소스 시스템** 및 그 무한한 배포판들이 공존하는 형태와 비슷할 것이라고 예상했습니다 [12]. 그는 '라마(Llama)', '미스트랄(Mistral)' 등과 같은 모델이 '오픈 소스'로 불리지만, 실제로 이는 **'오픈 웨이트(open weights)' 모델**이라고 지적하며 명칭의 정확성을 강조했습니다 [12, 13]. 오픈 웨이트 모델은 바이너리 형태로 제공되어 유용하지만, 모델을 완전히 미세 조정할 수는 없다는 한계가 있습니다 [14]. 모델을 미세 조정할수록 다른 부분에서 성능 저하가 발생할 수 있기 때문에, 새로운 기능을 추가하고 기존 기능을 유지하려면 이전 데이터셋 분포와 새로운 데이터셋 분포의 혼합으로 훈련해야 하는데, 단순히 웨이트만으로는 이 훈련 루프와 데이터셋에 접근할 수 없기 때문입니다 [13, 14]. 반면, '피아(Pia) 모델', 'LLM 360', '알모(Almo)' 등과 같은 **완전히 오픈 소스인 LLM**은 데이터 수집부터 모델 훈련에 필요한 전체 인프라를 공개한다고 설명했습니다 [14].
**규모(Scale)의 중요성과 다른 요소들**
Karpathy는 AI 개발에 있어 **규모(데이터, 컴퓨팅 규모)가 단연 가장 중요한 요소**라고 말했습니다 [15]. 그는 규모를 "속도 제한"에 비유하며, 규모가 없으면 대규모 모델을 훈련할 수 없다고 단언했습니다 [15]. 그러나 규모만으로는 충분하지 않으며, **데이터셋 준비와 정제, 알고리즘** 등 세부 사항도 중요하다고 덧붙였습니다 [15]. 또한, 대규모 모델을 훈련하는 것은 여전히 **극도로 어려운 분산 최적화 문제**이며 [16, 17], 인프라가 아직 초기 단계이고 [16], **희소한 전문 인력** (인프라, 알고리즘, 데이터 측면)이 필요하다고 강조했습니다 [17, 18]. 수만 개의 GPU가 무작위로 실패하는 상황에서 이를 계측하고 작동시키는 것은 엄청난 도전이며 [17], GPU가 최근까지 수만 개 워크로드용으로 설계되지 않았기 때문에 현재 인프라가 압력을 받고 있다고 설명했습니다 [18].
**LLM 연구의 현재 과제**
Karpathy가 밤에 고민하는 LLM 연구 과제들은 다음과 같습니다:
1. **확산 모델(Diffusion models)과 자기회귀 모델(Autoaggressive models)의 통합**: 현재 두 모델이 분포를 나타내는 두 가지 별개의 지점이며, 서로 다른 양식에 적합하게 보이지만, 이들을 통합하거나 연결하여 두 가지 장점을 모두 얻는 하이브리드 아키텍처를 찾는 공간이 있을 것이라고 생각합니다 [19].
2. **에너지 효율성 개선**: 인간 뇌의 20W 소비량과 비교하여, 현재 슈퍼컴퓨터는 메가와트 단위의 전력을 소비합니다 [20]. Karpathy는 **효율성 측면에서 1천 배에서 1백만 배 정도의 차이**가 있다고 추정하며 [20], 이는 컴퓨터 아키텍처가 워크로드에 잘 맞지 않기 때문이라고 지적합니다 [21].
* 이를 해결하기 위한 주요 **레버**로 **정밀도(precision)** 감소 (64비트에서 4, 5, 6비트 또는 1.58비트까지) [22]와 **희소성(sparsity)** 활용 (뇌가 항상 완전히 활성화되어 있지 않듯이) [22, 23]을 꼽았습니다.
* 또한, **폰 노이만 아키텍처(Von Neumann architecture)**의 한계(메모리와 코어 간의 데이터 이동)를 넘어서는 새로운 컴퓨터 아키텍처 혁신이 필요하다고 강조했습니다 [23]. 트랜스포머는 GPU에 맞춰 설계된 매우 병렬적인 아키텍처로, 순차적 의존성이 있는 RNN의 한계를 극복한 예시입니다 [24].
**일론 머스크(Elon Musk)의 경영 방식**
Karpathy는 일론 머스크가 매우 독특한 방식으로 회사를 운영한다고 말했습니다 [25].
* **작고 강력하며 기술 중심의 팀**: 그는 팀이 성장하는 것에 반대하며, 직원 채용에 노력을 기울여야 할 정도였다고 합니다 [26]. 또한, 기본적으로 성과가 낮은 직원을 해고하는 데 적극적이어서, Karpathy는 팀원을 유지하기 위해 싸워야 했다고 언급했습니다 [26]. 중간 관리직은 기술 전문성이 없는 경우를 선호하지 않습니다 [26].
* **생동감 있는 분위기(Vibes)**: 머스크는 사무실이 활기차고, 사람들이 돌아다니며 흥미로운 작업을 하고, 코딩하는 모습을 선호합니다 [27]. 정체를 싫어하며 [27], 비효율적인 대규모 회의를 싫어하고, 회의가 유용하지 않다면 자리를 뜨는 것을 권장합니다 [27]. 일반적인 대기업들이 직원을 지나치게 응석받이로 대하는 것과 달리, 머스크의 문화는 **최고의 기술적 작업을 수행하는 데 집중하고 강도 높게 임하는 것**이라고 설명했습니다 [28].
* **팀과의 직접적인 소통**: 일반적인 CEO와 달리, 머스크는 사무실에 와서 엔지니어들과 직접 대화합니다 [28, 29]. 그는 VP나 이사들과만 이야기하는 것을 원치 않고, **엔지니어들이 "진실의 근원(source of Truth)"**이라고 믿으며, 그들과 직접 소통하여 실제 상황을 이해하고 개선 방안을 논의하려 합니다 [29, 30].
* **문제 해결을 위한 '큰 망치(large hammer)'**: 엔지니어들이 병목 현상(예: GPU 부족)을 이야기하면, 머스크는 즉시 개입하여 해결합니다 [30, 31]. 예를 들어, GPU 클러스터 증설에 대한 답변이 만족스럽지 않으면, Nvidia CEO인 Jensen에게 직접 전화하여 병목 현상을 제거하는 등 **조직 내에서 자신의 영향력을 행사하는 데 주저하지 않습니다** [31, 32].
Karpathy는 이러한 경험을 통해 일반적인 회사에서는 느낄 수 없는 측면들을 그리워하게 된다고 언급했습니다 [32]. 창업가들이 머스크의 경영 방식을 따라야 할지에 대한 질문에, Karpathy는 창업가의 **DNA와 일치**해야 하며, **초기에 회사의 문화를 명확히 하고 일관성을 유지**한다면 가능한 모델이라고 답했습니다 [33, 34].
**개인적인 의미와 AI 생태계 비전**
Karpathy에게 가장 큰 의미를 부여하는 것은 특정 회사를 넘어 **건강하고 번성하는 AI 생태계**를 만드는 것입니다 [35]. 그는 스타트업들이 번창하고, 경제의 모든 틈새시장에 흥미로운 스타트업들이 가득한 **"산호초(coral reef)" 같은 생태계**를 꿈꾼다고 말했습니다 [36]. AGI가 권력을 증폭시키는 도구가 될 수 있음을 고려할 때, 소수의 거대 기업이 생태계를 장악하는 것에 대해 우려를 표했습니다 [33, 36].
**모델 구성 가능성(Model Composability)**
Karpathy는 전통적인 코드는 매우 구성 가능하지만, 신경망은 기본적으로 연결성이 더 높고 구성 가능성이 낮다고 설명합니다 [34, 37]. 그러나 부분적으로는 구성이 가능하며, **구성 요소를 사전 훈련(pre-train)하고 나중에 전체 시스템에 플러그인하여 미세 조정(fine-tune)하는 방식**으로 활용될 수 있다고 언급했습니다 [37].
**AGI 또는 '물리학자 모델'로의 경로**
현재 AI 모델들은 물리학자나 폰 노이만 유형의 모델처럼 물리적 세계의 일관된 정신 모델을 구축하고 새로운 아이디어를 생성하는 데 충분하지 않다고 Karpathy는 생각합니다 [38, 39]. 그는 현재 우리가 **"알파고의 1단계" (모방 학습)**를 완료했을 뿐이며, **"2단계" (강화 학습)**를 아직 수행하지 않았다고 주장합니다 [39, 40]. 인간 피드백 기반 강화 학습(RLHF)은 **"매우 약한 형태의 강화 학습"이며 "분위기 체크(vibe check)"에 불과**하다고 비판했습니다 [41, 42]. 인간의 심리와 모델의 심리가 다르기 때문에, 인간이 제공하는 이상적인 해결책 데이터는 모델에게는 적합하지 않을 수 있다고 지적합니다 [43]. 모델은 **스스로 문제 해결을 연습하고, 자신의 능력과 지식에 기반하여 무엇이 작동하고 작동하지 않는지 파악**해야 한다고 강조하며 [44], 이는 마치 **"AI 모델을 위한 대학원"**과 같다고 비유했습니다 [45]. 또한, 모델이 지식을 단순히 읽는 것을 넘어, 노트를 필기하고, 다시 표현하고, 재구성하는 등 **지식을 조작하는 방식의 학습**이 아직 LLM에는 없다고 덧붙였습니다 [46].
**비용 절감과 수익 창출 vs. 고품질 모델**
창업가들에게 Karpathy는 **성능과 정확도를 최우선으로 추구한 다음, 나중에 비용을 최적화**하는 방식을 권장합니다 [47]. 먼저 가장 유능하고 값비싼 모델(예: GPT-4)을 사용하여 목표를 달성한 다음 [46], 특정 유형의 쿼리에 대해 더 저렴한 모델(예: GPT-3.5)로 전환할 수 있는지 확인하거나 [47], 대규모 분포의 문제 유형에 대해 값비싼 모델로 레이블을 얻고 이를 바탕으로 작고 저렴한 모델을 미세 조정하는 **"증류(distillation)" 방식**을 사용할 수 있다고 제안했습니다 [48].
**오픈 소스 생태계의 발전**
Karpathy는 오픈 소스 생태계가 폐쇄형 개발 속도를 따라갈 수 있을지에 대해 매우 중요한 질문이라고 언급하며 [49], **모델 훈련에 필요한 막대한 자본**이 큰 문제라고 지적합니다 [49]. 메타(Meta)와 같은 대기업들은 대규모 모델을 훈련할 자원을 가지고 있으면서도, 그들의 핵심 사업과 직접적인 관련이 없기 때문에 생태계 전체를 강화하기 위해 일부 모델을 공개할 인센티브가 있다고 보았습니다 [50]. 그러나 그는 아직 **'오픈 웨이트' 모델만을 공개**하고 있으며, **'완전히 오픈 소스' 모델로 더 나아가야 한다**고 주장했습니다 [50]. 데이터와 관련된 민감성 때문에 주저할 수 있지만, 투명성을 높이는 것이 생태계에 더 좋을 것이라고 말했습니다 [51].
**AI 생태계를 더욱 활성화하기 위한 제안**
Karpathy는 AI 생태계를 더욱 활기차게 만들려면 **"램프(ramps)"를 구축**하여 사람들이 이 기술을 이해하고 효과적으로 사용하는 데 도움을 주어야 한다고 생각합니다 [52]. 많은 사람들이 '무엇(the thing)'을 만드는 데 집중하지만, **사람들이 '무엇'을 이해하고 사용할 수 있도록 돕는 '램프'를 만드는 노력은 부족하다**고 지적합니다 [52]. 그는 사람들이 **배운 것, 모델을 훈련한 방법, 무엇이 작동하고 작동하지 않는지 등을 서로 더 많이 공유하고 개방적**이기를 바랍니다 [53]. 또한, 오픈 생태계의 현재 모멘텀을 인정하면서도 개선의 여지가 있다고 봅니다 [53].
**트랜스포머 아키텍처의 미래**
트랜스포머 아키텍처는 **엄청나게 놀라운 모델**이며, 이 필드에 오랜 시간 있었음에도 그 등장을 예측하지 못했다고 말했습니다 [53, 54]. 한때 신경망의 다양화가 심화될 것이라 생각했지만, 실제로는 트랜스포머 하나로 모든 것이 수렴되는 정반대 현상이 일어났다고 언급했습니다 [54]. 그러나 그는 트랜스포머가 **'최종 신경망'은 아닐 것이라고 확신**하며 [54], 현재 방식에 **상당한 변화를 가져올 누군가가 있을 것**이라고 낙관적으로 보았습니다 [55]. 자기회귀 및 확산 모델 분야에서 새로운 가능성이 있을 것이며 [55], **정밀도, 희소성**과 같은 레버를 활용하고 하드웨어 공동 설계와 함께 **컴퓨터 아키텍처**를 발전시키는 방향으로 변화가 올 것이라고 예측했습니다 [24, 55]. 트랜스포머는 GPU에 맞춰 **근본적으로 병렬화 가능하도록 설계된 모델**이라는 점을 강조하며, 이는 하드웨어에 알고리즘을 최적화한 좋은 예시라고 설명했습니다 [24, 56]. 비록 6~7년 전 개발되었지만 놀라울 정도로 회복력이 강하다고 덧붙였습니다 [56].
**창업가들을 위한 마지막 조언**
Karpathy는 창업가들에게 자신들의 스타트업뿐만 아니라 **스타트업들이 대기업과 경쟁하며 승리하고, 전체 생태계가 건강하게 유지되는 방법**에 대해 고민할 것을 권했습니다 [57]. 그는 농담 반 진담 반으로 "투자자가 되는 것이 좋을 것 같다"고 말하며 대화를 마무리했습니다 [57].