https://youtu.be/p8Jx4qvDoSo?si=6YOsR8A0HcYPZwTo
- 안녕하세요, 저는 제러드 카플란입니다. 확장성과 인간 수준 AI로 향하는 길에 대해 간략히 말씀드리겠습니다. 하지만 이 자리의 청중에게는 많은 아이디어가 이미 익숙하실 것 같으니 짧게 말씀드리고, 다이애나와 함께 자유로운 형식의 질의응답 시간을 갖겠습니다. 저는 AI 분야에서 일한 지 6년밖에 되지 않았습니다. 그 전에는 이론 물리학자로 학계에서 오랫동안 경력을 쌓았습니다. 어떻게 AI 분야에 오게 되었냐고요? 간단히 말씀드리자면, 제가 물리학을 시작한 이유는 기본적으로 저희 어머니께서 공상과학 소설가셨고, 저는 광속보다 빠른 드라이브를 만들 수 있는지 알아내고 싶었으며, 물리학이 그 방법이었습니다. 저는 또한 우주를 이해하는 것 자체에 매우 흥미를 느꼈습니다. 모든 것의 근간이 되는 가장 큰 경향들이 어떻게 작동하고 어디서 오는가? 예를 들어, 우주는 결정론적인가? 우리에게 자유 의지가 있는가? 저는 이러한 질문들에 매우 흥미를 느꼈습니다. 하지만 다행히도 물리학자로서의 경력 동안 저는 매우 흥미롭고 심오한 많은 사람들을 만났습니다. 현재 제가 항상 함께 일하고 있는 앤트로픽의 창립자들도 그중 다수입니다. 그들이 하는 일에 정말 관심이 많아서 계속 지켜봤습니다. 대형 강입자 충돌기 물리학, 입자 물리학, 우주론, 끈 이론 등 물리학 내의 여러 주제 분야를 옮겨 다니면서, 저는 조금 좌절하고 지루함을 느꼈습니다. 진전이 충분히 빠르다고 생각하지 않았습니다. 그리고 많은 친구들이 AI가 정말 큰 일이 되고 있다고 말해주었지만, 저는 믿지 않았습니다. 저는 회의적이었습니다. '음, AI 사람들은 50년 동안 연구해왔고, SVM은 그렇게 흥미롭지 않아'라고 생각했습니다. 2005년에서 2009년 제가 학교에 다닐 때 우리가 알던 것은 그것뿐이었습니다. 하지만 저는 AI가 흥미로운 분야가 될 수도 있다고 확신하게 되었고, 운 좋게도 적절한 사람들을 알게 되었으며, 나머지는 다 아시다시피 역사가 되었습니다. 그래서 저는 현대 AI 모델이 어떻게 작동하고, 확장이 어떻게 모델을 점점 더 좋게 만드는지에 대해 조금 이야기할 것입니다. 클로드, 챗GPT 등 현대 AI 모델의 훈련에는 두 가지 근본적인 단계가 있습니다.
- 첫 번째 단계는 사전 훈련이며, 여기서 AI 모델은 사람이 작성한 데이터, 즉 사람이 작성한 텍스트를 모방하고 해당 데이터에 깔린 상관관계를 이해하도록 훈련됩니다. 이 그림들은 매우 복고적입니다. 이것은 실제 원본 GPD3 모델의 놀이터에서 가져온 것입니다. 그리고 저널 클럽에서 발표자로서 '코끼리'와 같은 특정 단어를 말하는 것이 매우 매우 드물다는 것을 알 수 있습니다. 사전 훈련은 모델에게 대규모 코퍼스의 텍스트에서 어떤 단어가 다른 단어 뒤에 올 가능성이 높은지, 그리고 이제는 현대 모델에서 멀티모달 데이터에서도 이를 가르칩니다. 현대 AI 모델 훈련의 두 번째 단계는 강화 학습입니다. 이것 또한 매우 복고적인 슬라이드입니다. 클로드 제로 또는 클로드 마이너스 원의 초기 버전을 위해 2022년 고대 시절에 피드백 데이터를 수집할 때 사용했던 원본 인터페이스를 보여줍니다. 여기서 보시는 것은 기본적으로 클로드의 아주 초기 버전과 대화하고, 여러분이나 크라우드워커 등에 따르면 클로드의 어떤 응답이 더 나은지 선택하는 인터페이스입니다. 그리고 그 신호를 사용하여 우리는 좋다고 선택된, 즉 도움이 되고 정직하며 해롭지 않다고 선택된 행동들을 최적화하고 강화합니다. 그리고 나쁜 행동들은 단념시킵니다. 따라서 이 모델들을 훈련하는 것은 다음 단어를 예측하는 것을 배우고, 그 다음 유용한 작업을 수행하기 위해 강화 학습을 하는 것이 전부입니다. 그리고 이 두 훈련 단계 모두에 대한 스케일링 법칙이 있다는 것이 밝혀졌습니다. 이것은 저희가 5, 6년 전에 만든 그림인데, AI의 사전 훈련 단계를 확장함에 따라 우리 모델의 성능이 예측 가능하게 점점 더 좋아지는 것을 보여줍니다. 그리고 이것은 제가 그냥 가능한 가장 멍청한 질문을 던지면서 알게 된 것입니다. 물리학자로서 그것이 훈련의 일부입니다. 전체적인 그림을 보고 정말 멍청한 질문을 던지는 것이죠. 2010년대에는 빅데이터가 중요하다는 말이 매우 인기가 많았고, 그래서 저는 데이터가 얼마나 커야 하는지, 얼마나 중요한지, 얼마나 도움이 되는지 알고 싶었습니다. 마찬가지로, 많은 사람들이 더 큰 AI 모델이 더 나은 성능을 보인다는 것을 알아챘고, 그래서 우리는 이 모델들이 얼마나 더 나은 성능을 보이는지에 대한 질문을 던졌습니다.
- 우리는 정말 운이 좋았습니다. AI 훈련의 기저에는 정말 매우 매우 정확하고 놀라운 무언가가 있다는 것을 발견했습니다. 이것은 물리학이나 천문학에서 볼 수 있는 어떤 것만큼이나 정확한 이러한 멋진 경향들이 있다는 점이 우리를 정말 놀라게 했습니다. 그리고 이는 AI가 매우 예측 가능한 방식으로 계속해서 똑똑해질 것이라는 강한 확신을 주었습니다. 왜냐하면 이 그림에서 이미 2019년에 우리는 계산량, 데이터셋 크기, 신경망 크기에서 여러 자릿수를 가로질러 관찰하고 있었기 때문입니다. 따라서 여러 자릿수에 걸쳐 어떤 것이 사실임을 일단 알게 되면, 그것이 오랫동안 계속 사실일 것이라고 기대하게 됩니다. 따라서 이것이 AI 개선의 근본적인 것 중 하나라고 생각합니다. 또 다른 하나는 사실 꽤 오래 전부터 나타나기 시작했지만, 지난 몇 년 동안 정말 엄청난 영향을 미친 것입니다. 바로 AI 훈련의 강화 학습 단계에서도 스케일링 법칙을 볼 수 있다는 것입니다. 약 4년 전 한 연구자가 알파고에 대한 스케일링 법칙을 연구하기로 결정했습니다. 기본적으로 두 가지 매우 유명한 AI 성공작, 즉 사전 훈련을 위한 GPD3와 스케일링, 그리고 알파고를 결합한 것이죠. 이것은 연구자 앤디 존스가 고대 시대인 그 시절에 아마도 단일 GPU로 혼자 작업한 것입니다. 그래서 그는 비용이 많이 드는 알파고를 연구할 수 없었지만, 헥스라는 더 간단한 게임을 연구할 수 있었습니다. 그래서 그는 여기서 보시는 이 플롯을 만들었습니다. 당시에는 ELO 점수가 그렇게 잘 알려지지 않았던 것 같지만, ELO 점수는 물론 체스 레이팅입니다. 기본적으로 한 선수가 체스 게임에서 다른 선수를 이길 확률을 나타냅니다. 지금은 AI 모델을 벤치마킹하여 인간이 어떤 AI 모델을 다른 AI 모델보다 선호하는 빈도를 측정하는 데 사용됩니다. 하지만 당시에는 이것이 ELO 점수의 고전적인 적용 방식, 즉 체스 레이팅이었습니다. 그리고 그는 이 헥스 게임(고보다 훨씬 간단한 보드 게임)을 플레이하도록 다른 모델들을 훈련했을 때 어떻게 되는지 살펴보았고, 놀라운 직선 경향을 보았습니다. 따라서 매우 간단한 경향을 알아차리는 것은 과학의 기술이며, 저는 이것이 하나의 예시라고 생각합니다.
- 저는 사람들이 RL에서 이런 종류의 스케일링 행동에 충분히 일찍 주목하지 않았다고 생각합니다. 그러나 결국 그렇게 되었습니다. 그래서 우리는 기본적으로 사전 훈련과 RL 모두에서 계산량을 늘려 점점 더 나은 성능을 얻을 수 있다는 것을 알 수 있습니다. 그리고 그것이 AI 발전을 이끄는 근본적인 것이라고 생각합니다. AI 연구자들이 정말 똑똑하거나 갑자기 똑똑해진 것이 아니라, AI를 체계적으로 더 좋게 만들 수 있는 아주 간단한 방법을 찾았고, 우리는 그 노력을 계속하고 있습니다. 이것이 어떤 종류의 능력을 가능하게 하는가? 저는 AI 능력을 두 가지 축으로 생각하는 경향이 있습니다. 덜 흥미로운 축이지만 여전히 매우 중요한 것은 기본적으로 AI의 유연성, 즉 AI가 우리에게 맞춰줄 수 있는 능력입니다. 예를 들어, 이 그림에 알파고를 놓으면 X축 아래로 매우 멀리 떨어질 것입니다. 알파고는 매우 지능적이었고 어떤 바둑 플레이어보다도 바둑을 잘 두었지만, 바둑판이라는 우주 안에서만 작동할 수 있었기 때문입니다. 그러나 우리는 대규모 언어 모델의 등장 이후 꾸준히 발전하여, 사람들이 다룰 수 있는 많은 모든 양식을 다룰 수 있는 AI를 만들고 있습니다. 아직 냄새를 맡을 수 있는 AI 모델은 없지만, 그것도 곧 나올 것입니다. 그래서 여기서 Y축을 올라갈수록 세상에서 점점 더 많은 관련 작업을 수행할 수 있는 AI 시스템에 도달하게 됩니다. 그러나 제가 생각하기에 더 흥미로운 축은 X축입니다. AI 모델이 수행할 수 있는 종류의 작업을 사람이 수행하는 데 얼마나 오랜 시간이 걸리는가 하는 것입니다. 그리고 이것은 AI의 능력이 증가함에 따라 꾸준히 증가하고 있습니다. 이것은 작업의 시간 지평과 같으며, 미터라는 조직이 이를 매우 체계적으로 연구하여 또 다른 스케일링 경향을 발견했습니다. 그들은 AI 모델이 수행할 수 있는 작업의 길이가 약 7개월마다 두 배가 된다는 것을 발견했습니다. 그래서 이것이 의미하는 바는 사전 훈련과 RL을 위한 계산량 확장을 통해 AI에 주입되는 증가하는 지능이 AI 모델이 수행할 수 있는 예측 가능하고 유용한 작업, 즉 점점 더 긴 지평 작업을 가능하게 한다는 것입니다. 따라서 이것이 어디로 향하는지 추측할 수 있으며, AI 2027 사람들도 그렇게 했습니다.
- 이와 같은 그림은 다음 몇 년 안에 AI 모델이 단지 몇 분이나 몇 시간뿐만 아니라 며칠, 몇 주, 몇 달, 몇 년이 걸리는 작업을 수행할 수 있는 지점에 도달할 수 있음을 시사합니다. 결국 우리는 AI 모델 또는 아마도 수백만 개의 AI 모델이 함께 작동하여 전체 인간 조직이 할 수 있는 작업을 수행할 수 있을 것이라고 상상합니다. 현재 전체 과학 커뮤니티가 수행하는 종류의 작업을 할 수 있을 것입니다. 수학이나 이론 물리학의 좋은 점 중 하나는 생각만으로도 진전을 이룰 수 있다는 것입니다. 따라서 AI 시스템이 함께 작동하여 이론 물리학 커뮤니티가 50년 동안 이루는 진전을 며칠, 몇 주 안에 이룰 수 있다고 상상할 수 있습니다. 그렇다면 이런 종류의 스케일링 그림이 우리를 매우 멀리 데려갈 수 있다면, 무엇이 남아 있는가? 제 생각에 인간 수준의 AI를 넓게 해석하여 잠금 해제하는 데 필요한 것은 비교적 간단하다고 생각합니다. 가장 중요한 요소 중 하나는 관련 조직 지식이라고 생각합니다. 우리는 단순히 백지 상태로 여러분을 맞이하는 것이 아니라, 회사, 조직, 정부 내에서 마치 수년 동안 일한 사람처럼 맥락을 가지고 일하는 법을 배울 수 있는 AI 모델을 훈련해야 합니다. 따라서 AI 모델은 지식과 함께 작동할 수 있어야 한다고 생각합니다. 또한 기억도 필요합니다. 기억이 지식이 아니라면 무엇인가? 저는 오랜 시간이 걸리는 작업을 수행할 때 진행 상황을 추적하고 관련 기억을 구축하고 그것을 사용할 수 있어야 한다는 점에서 구별합니다. 그리고 이것은 클로드 4에 구축하기 시작한 것이며, 점점 더 중요해질 것이라고 생각합니다. 세 번째 요소는 우리가 더 잘해야 하고 진전을 이루고 있는 감시 능력입니다. AI 모델이 미묘한 뉘앙스를 이해하고 어려운 모호한 작업을 해결하는 능력입니다. 지금은 테스트를 통과하는 코드를 작성하거나 수학 문제를 올바르게 답하는 AI 모델을 훈련하는 것이 쉽습니다. 왜냐하면 무엇이 맞고 무엇이 틀렸는지 매우 명확하기 때문입니다. 따라서 강화 학습을 적용하여 AI 모델이 그러한 종류의 작업에서 점점 더 잘하도록 만드는 것이 매우 쉽습니다.
- 우리가 필요로 하고 개발 중인 것은 훨씬 더 미묘한 보상 신호를 생성하는 데 도움이 되는 AI 모델입니다. 이를 통해 우리는 강화 학습을 사용하여 좋은 농담을 하거나, 좋은 시를 쓰거나, 연구에서 좋은 취향을 갖는 것과 같은 일들을 할 수 있습니다. 우리가 필요한 다른 요소들은 더 간단합니다. 우리는 분명히 AI 모델이 점점 더 복잡한 작업을 수행하도록 훈련할 수 있어야 합니다. 우리는 텍스트 모델에서 멀티모달 모델, 로봇 공학으로 Y축을 따라 나아가야 합니다. 그리고 저는 앞으로 몇 년 동안 이러한 다양한 영역에 적용될 때 스케일링을 통해 계속해서 얻게 될 이득을 볼 것이라고 예상합니다. 그렇다면 이러한 미래, 이러한 가능성에 어떻게 대비해야 할까요? 저는 항상 몇 가지를 추천합니다. 첫째, 아직 완벽하게 작동하지 않는 것을 만드는 것이 정말 좋은 생각이라고 생각합니다. 이것은 아마 항상 좋은 생각일 것입니다. 우리는 항상 야망을 가져야 하지만, 특히 AI 모델은 지금 매우 빠르게 발전하고 있습니다. 그리고 저는 이것이 계속될 것이라고 생각합니다. 이는 클로드 4가 아직 너무 멍청해서 완벽하게 작동하지 않는 제품을 만들더라도, 그 제품을 작동시키고 많은 가치를 제공할 클로드 5가 나올 것이라고 예상할 수 있다는 의미입니다. 그래서 저는 항상 AI가 할 수 있는 것의 경계에서 실험해 보라고 권합니다. 왜냐하면 그 경계가 빠르게 움직이고 있기 때문입니다. 다음으로, 저는 AI가 AI 통합에 도움이 될 것이라고 생각합니다. AI의 주요 병목 중 하나는 정말 빠르게 발전하고 있어서 우리가 그것을 제품, 회사, 다른 모든 것, 과학 등에 통합할 시간이 없다는 것입니다. 그래서 그 과정을 가속화하기 위해 AI를 AI 통합에 활용하는 것이 매우 가치 있을 것이라고 생각합니다. 그리고 마지막으로, 이 자리에 계신 분들에게는 분명한 이야기겠지만, AI의 채택이 매우 빠르게 일어날 수 있는 곳을 파악하는 것이 중요합니다. 우리는 코딩을 위한 AI 통합의 폭발적인 증가를 보고 있습니다. 소프트웨어 공학이 AI에게 훌륭한 곳인 많은 이유가 있지만, 저는 큰 질문은 '다음은 무엇인가?' 즉 소프트웨어 공학을 넘어 무엇이 그렇게 빠르게 성장할 수 있는가라고 생각합니다.
- 저는 물론 답을 모릅니다. 하지만 여러분이 알아낼 것이라고 희망합니다. 이것으로 강연은 끝입니다. 다이애나를 무대로 초대하여 대화를 나누겠습니다. YC의 다음 배치는 현재 신청을 받고 있습니다. 스타트업 아이디어가 있다면 ycombinator.com/apply로 신청하세요. 너무 이른 시점은 없으며, 신청서를 작성하는 것만으로도 아이디어를 한 단계 발전시킬 수 있습니다. 좋습니다, 영상으로 돌아갑시다. 확장성 법칙에 대한 정말 멋진 강연이었습니다. 그리고 최근 앤트로픽은 클로드 4를 출시했는데, 이제 막 사용 가능합니다. 이러한 모델 출시가 다음 12개월 동안 계속해서 쌓이면서 무엇이 가능해지는지 궁금합니다. 제 생각에 12개월 안에 더 나은 모델이 나오지 않는다면 우리는 곤경에 처할 것입니다. 하지만 클로드 4에 관해서는 몇 가지 말씀드리겠습니다. 클로드 3.7 소넷도 코딩에 사용하기에 정말 흥미로웠지만, 모두가 알아챘던 것은 3.7이 너무 의욕적이었다는 것입니다. 때로는 정말 테스트를 통과하고 싶어 했고, 여러분이 원하지 않는 일들, 예를 들어 많은 'try except' 같은 것들을 했습니다. 그래서 클로드 4에서는 모델의 에이전트로서의 능력을 향상시킬 수 있었다고 생각합니다. 특히 코딩뿐만 아니라 검색, 다른 모든 종류의 응용 프로그램에서도요. 또한 제 강연에서 언급했던 감시, 즉 감독을 개선하여 여러분의 지시를 따르고 코드 품질을 향상시키기를 바랍니다. 저희가 작업한 또 다른 것은 메모리를 저장하고 보관하는 능력의 향상입니다. 클로드 4는 매우 복잡한 작업으로 인해 컨텍스트 창을 다 쓸 수 있지만, 파일이나 기록으로 메모리를 저장하고 검색하여 여러 컨텍스트 창에 걸쳐 작업을 계속할 수 있기 때문에 사람들이 이를 활용하기를 바랍니다. 하지만 마지막으로, 스케일링 법칙이 그리는 그림은 점진적인 발전의 그림이라고 생각합니다. 따라서 클로드와 함께 보게 될 것은 각 릴리스마다 다양한 방식으로 꾸준히 개선된다는 것입니다. 그러나 저는 스케일링이 인간 수준 AI 또는 AGI를 향한 일종의 부드러운 곡선을 제시한다고 생각합니다.
- 이 자리의 많은 청중을 흥분시킬 만한 특별한 기능, 여러분에게 알려줄 만한 비밀 정보는 없나요? 새로운 API와 관련해서 사람들이 가장 좋아할 만한 것이 무엇이라고 생각하시나요? 제가 가장 기대하는 것은 메모리가 점점 더 긴 시간 지평의 작업을 가능하게 하는 것입니다. 시간이 지남에 따라 클로드가 점점 더 큰 작업 덩어리를 맡을 수 있는 협력자가 될 것이라고 생각합니다. 이것은 미래 모델들이 점점 더 큰 작업을 수행할 수 있다는 여러분의 요점과도 일맥상통합니다. 현재는 몇 시간 단위의 작업을 할 수 있습니다. 네, 그렇게 생각합니다. 매우 부정확한 측정치이지만, 지금 소프트웨어 공학 작업을 보면 미터가 사람들이 다양한 작업을 수행하는 데 얼마나 걸리는지 문자 그대로 벤치마킹했다고 생각하며, 네, 몇 시간 정도의 시간 단위라고 생각합니다. 일반적으로 사람들이 AI와 함께 작업할 때, AI에 회의적인 사람들은 AI가 많은 어리석은 실수를 저지른다고 정확하게 말할 것입니다. AI는 정말 놀랍고 감탄스러운 일들을 할 수 있지만, 기본적인 오류도 저지를 수 있습니다. 제가 생각하기에 AI 지능의 형태가 인간 지능과 다른 기본적인 특징 중 하나는, 제가 할 수 없는 많은 일들이 있지만, 적어도 그것이 올바르게 수행되었는지 판단할 수 있다는 것입니다. AI의 경우 판단 능력과 생성 능력이 훨씬 더 가깝습니다. 이는 사람들이 AI와 상호 작용하는 데 있어 주요 역할 중 하나가 일종의 관리자로서 작업의 정상 여부를 확인하는 것이 될 수 있다는 의미입니다. 이것은 매혹적입니다. 왜냐하면 작년에 YC 배치에서 우리가 관찰한 것 중 하나는, 많은 회사들이 제품을 판매할 때 여전히 코파일럿으로 판매했다는 것입니다. 예를 들어, 고객 지원을 위한 코파일럿이 있어서 고객에게 답장을 보내기 전에 마지막으로 인간의 승인이 필요했습니다. 그러나 이번 봄 배치에서 바뀐 한 가지는, AI 모델들이 여러분의 말처럼 작업을 처음부터 끝까지 수행할 수 있을 정도로 매우 유능하다는 것입니다. 이는 놀라운 일입니다. 창업자들은 이제 전체 워크플로우를 직접적으로 대체하는 제품을 판매하고 있습니다. 이것이 여러분이 청중이 만들기를 바라는 것에 어떻게 반영되고 있습니까?
- 많은 가능성이 있습니다. 기본적으로 어떤 수준의 성공 또는 성능이 허용 가능한지의 문제입니다. 어떤 작업은 70% 정도만 맞아도 괜찮지만, 어떤 작업은 배포하려면 99.9%가 필요합니다. 솔직히 제 생각에는 70~80% 정도면 충분한 사용 사례를 위해 개발하는 것이 훨씬 더 재미있을 것입니다. 그러면 AI가 할 수 있는 것의 최전선에 도달할 수 있기 때문입니다. 하지만 우리는 신뢰성 또한 높이고 있습니다. 따라서 이러한 작업들을 점점 더 많이 보게 될 것이라고 생각합니다. 지금은 인간과 AI의 협업이 가장 흥미로운 분야가 될 것이라고 생각합니다. 가장 진보된 작업의 경우 인간이 개입해야 할 것이기 때문입니다. 그러나 장기적으로는 점점 더 많은 작업이 완전히 자동화될 수 있다고 생각합니다. 이 인간과 AI의 협업 루프를 통해 세상이 어떻게 보일지에 대해 더 자세히 말씀해 주실 수 있나요? 다리오의 '사랑과 은혜의 기계들'이라는 에세이가 있는데, 그는 매우 낙관적인 그림을 그렸습니다. 이 책으로 어떻게 거기에 도달할 수 있는지 자세히 설명해 주시겠어요? 이미 일부가 일어나고 있다고 생각합니다. 적절한 종류의 오케스트레이션만 있다면, 지금의 최첨단 AI 모델을 사용하여 예를 들어 신약 개발을 위한 흥미롭고 가치 있는 통찰력을 생산하는 것이 가능하다고 생물 의학 연구 분야에서 일하는 사람들과 이야기할 때 느낍니다. 따라서 그것은 이미 시작되고 있다고 생각합니다. 제가 생각하는 한 가지 측면은, 많은 깊이를 요구하는 지능이 있고, 많은 폭을 요구하는 지능이 있다는 것입니다. 예를 들어, 수학에서는 10년 동안 하나의 정리, 예를 들어 리만 가설이나 페르마의 마지막 정리를 증명하려고 노력할 수 있습니다. 저는 그것이 하나의 매우 구체적이고 매우 어려운 문제를 해결하는 것이라고 생각합니다. 생물학, 아마도 흥미롭게도 심리학이나 역사에서 더 많은 과학 분야에서, 다양한 분야에 걸쳐 매우 많은 양의 정보를 종합하는 것이 중요한 경우가 많습니다. 그리고 저는 AI 모델이 사전 훈련 단계에서 인류 문명의 모든 지식을 흡수한다고 생각합니다.
- 따라서 AI의 그러한 특성, 즉 어떤 한 인간 전문가보다 훨씬 더 많은 것을 알고 있다는 특성을 활용하여, 예를 들어 생물학 연구를 위해 여러 다른 전문 분야의 지식을 종합함으로써 통찰력을 이끌어낼 수 있는 많은 이점이 있다고 생각합니다. 따라서 우리는 어려운 코딩 문제, 어려운 수학 문제와 같은 더 깊은 작업에서 AI를 더 잘하도록 많은 진전을 이루고 있지만, 저는 어떤 한 인간 전문가도 가질 수 없는 지식을 종합하는 것이 매우 유용한 지능 유형인 분야에서는 특별한 이점이 있다고 생각합니다. 그래서 저는 이러한 종류의, 즉 AI의 지식의 폭을 활용하는 것을 더 많이 보게 될 것이라고 예상합니다. 정확히 어떻게 펼쳐질지에 대해서는 정말 모르겠습니다. 미래를 예측하는 것은 정말 어렵습니다. 스케일링 법칙은 미래를 예측하는 한 가지 방법을 제공합니다. 즉, 이 추세는 계속될 것이라는 것이죠. 장기적으로 우리가 보는 많은 추세가 계속될 것이라고 예상합니다. 경제, GDP, 이러한 종류의 추세는 미래의 정말 신뢰할 수 있는 지표입니다. 그러나 상세하게 어떻게 구현될지에 대해서는 정말 말하기 어렵다고 생각합니다. 많은 빌더들이 뛰어들 수 있는 특정 분야가 있습니까? 예를 들어 코딩 작업에는 많은 것이 이루어졌지만, 현재 모델로 인해 막 잠금 해제되는 새로운 분야는 무엇입니까? 저는 사업가라기보다는 연구자 배경을 가지고 있어서 깊이 있는 말을 할 수는 없지만, 일반적으로 많은 기술을 요구하고 주로 컴퓨터 앞에 앉아 데이터와 상호 작용하는 모든 곳은 가능성이 있다고 생각합니다. 금융 분야, 엑셀 스프레드시트를 많이 사용하는 사람들, 그리고 법률 분야도 그렇다고 생각합니다. 비록 법률은 더 규제가 많고, 승인을 위한 더 많은 전문 지식이 필요할 수 있겠지만요. 하지만 이 모든 분야는 아직 개척되지 않은 분야라고 생각합니다. 제가 언급했던 또 다른 분야는 AI를 기존 비즈니스에 어떻게 통합하는가입니다. 전기가 등장했을 때 긴 채택 주기가 있었고, 전기를 사용하는 가장 초기의 간단한 방법이 반드시 최고는 아니었습니다. 증기 기관을 전기 모터로 교체하는 것만이 아니라, 공장이 작동하는 방식을 전면적으로 재구성하기를 원했습니다. 그리고 AI를 경제의 여러 부분에 가능한 한 빨리 통합하기 위해 AI를 활용하는 데 많은 지렛대가 있다고 생각합니다. 또 다른 질문은, 당신은 물리학자로서 광범위한 훈련을 받았고, 스케일링 법칙이라는 이러한 추세를 실제로 처음으로 관찰한 사람 중 한 명입니다. 그리고 이것은 아마도 물리학자로서 자연에서 자연스럽게 발생하는 이러한 지수적 증가를 보는 것에서 비롯되었을 것입니다. 그러한 훈련이 AI 분야에서 세계 최고 수준의 연구를 수행하는 데 어떻게 도움이 되었습니까?
- 물리학적 관점에서 유용했던 것은 가장 큰 그림, 즉 가장 거시적인 경향을 찾고 그것들을 가능한 한 정밀하게 만드는 것이었습니다. 저는 “학습이 지수적으로 수렴하고 있다”고 말하는 정말 뛰어난 AI 연구자들을 만났던 것을 기억합니다. 저는 그저 “정말 지수적인가? 거듭제곱 법칙일 수도 있지 않을까? 이차 함수일까? 정확히 어떻게 수렴하고 있는가?”와 같은 정말 멍청하고 단순한 질문을 던졌습니다. 하지만 기본적으로, 당신이 보는 큰 경향들을 가능한 한 정밀하게 만들려고 노력하는 데에는 많은 이점이 있었고, 아마도 여전히 있을 것입니다. 왜냐하면 그것이 당신에게 많은 도구를 제공하기 때문입니다. 그것은 당신이 “정말로 변화를 가져온다는 것이 무엇을 의미하는가?”와 같은 질문을 할 수 있게 합니다. 스케일링 법칙에서는 궁극적인 목표가 스케일링 법칙의 더 나은 기울기를 찾는 것입니다. 왜냐하면 그것은 당신이 더 많은 계산량을 투입할수록 다른 AI 개발자들에 비해 점점 더 큰 이점을 얻게 될 것이라는 의미이기 때문입니다. 그러나 당신이 보는 추세를 정밀하게 만들기 전까지는, 그것을 이긴다는 것이 정확히 무엇을 의미하는지, 얼마나 이길 수 있는지, 그리고 그것을 체계적으로 달성하고 있는지 알 수 없습니다. 그래서 저는 그것들이 제가 사용했다고 생각하는 도구들이었다고 생각합니다. 양자장 이론을 AI에 문자 그대로 적용하는 것과는 반드시 같지는 않았습니다. 그것은 조금 너무 구체적입니다.
- 물리학의 특정 휴리스틱, 예를 들어 재규격화 대칭이 이러한 추세를 계속 관찰하거나 측정하는 데 매우 유용했습니까? AI 모델을 보면 큰 것을 알 수 있습니다. 신경망은 크고, 이제 수십억, 수조 개의 매개변수를 가지고 있습니다. 즉, 큰 행렬로 구성되어 있으며, 신경망이 매우 크고 특히 신경망을 구성하는 행렬이 크다는 근사를 연구하는 것이 실제로 유용했습니다. 그리고 그것은 실제로 물리학과 수학에서 잘 알려진 근사였습니다. 그것은 적용되었습니다. 그러나 일반적으로는 매우 순진하고 멍청한 질문을 던지는 것이 매우 큰 진전을 가져옵니다. AI는 어떤 의미에서는 현재의 AI 모델 훈련 방식의 형태로 볼 때 아마도 10년, 15년 정도밖에 되지 않았다고 생각합니다. 이는 매우 새로운 분야이며, AI 모델이 실제로 어떻게 작동하는지에 대한 해석 가능성 같은 가장 기본적인 질문들조차 아직 답이 나오지 않았습니다. 그래서 저는 매우 멋진 기술을 적용하기보다는 그 수준에서 배울 것이 정말 많다고 생각합니다. 해석 가능성에 물리학의 특정 도구를 적용합니까? 해석 가능성은 생물학에 훨씬 더 가깝습니다. 신경과학에 훨씬 더 가깝습니다. 그래서 저는 그러한 종류의 도구들이라고 생각합니다. 더 많은 수학이 있지만, 뇌의 특징을 이해하려고 노력하는 것과 더 비슷하다고 생각합니다. AI가 신경과학에 비해 얻는 이점은 AI에서는 모든 것을 측정할 수 있다는 것입니다. 뇌의 모든 뉴런과 모든 시냅스의 활동을 측정할 수는 없지만, AI에서는 그렇게 할 수 있습니다. 따라서 AI 모델이 어떻게 작동하는지 역설계하는 데 훨씬 더 많은 데이터가 있습니다. 스케일링 법칙의 한 가지 측면은 5차례 이상 규모에서 유지되었다는 것인데, 이것은 정말 놀라운 일입니다. 이것은 약간 반대되는 질문이지만, 곡선이 변하고 있다는, 즉 우리가 곡선에서 벗어나고 있다는 것을 확신시킬 만한 어떤 경험적 징후가 있을까요? 저는 정말 어려운 질문이라고 생각합니다. 왜냐하면 저는 주로 스케일링 법칙을 AI 훈련이 제대로 작동하는지 진단하는 데 사용하기 때문입니다.
- 따라서 일단 어떤 것을 보고 매우 설득력 있는 추세라고 생각하면, 그것이 어디에서 실패하고 있는지 살펴보는 것이 매우 흥미로워집니다. 그러나 제 첫 번째 생각은 스케일링 법칙이 실패하고 있다면, 그것은 우리가 AI 훈련을 어떤 식으로든 망쳤기 때문이라고 생각하는 경향이 있습니다. 아마도 신경망의 아키텍처를 잘못 설정했거나, 우리가 보지 못하는 훈련의 병목 현상이 있거나, 우리가 사용하는 알고리즘의 정밀도에 문제가 있을 수 있습니다. 따라서 지난 5년간의 경험상, 스케일링이 고장난 것처럼 보였을 때 우리가 잘못하고 있었기 때문이었으므로, 스케일링이 이러한 경험적 법칙 수준에서 더 이상 실제로 작동하지 않는다는 것을 저를 납득시키려면 많은 것이 필요할 것이라고 생각합니다. 흥미롭네요. 그렇다면 스케일링 곡선을 계속 따라가기 위해 필요한 많은 계산 능력과 밀접하게 관련된 매우 구체적인 질문으로 넘어가겠습니다. 계산이 점점 더 희소해지면 어떻게 됩니까? 정밀도 단계는 얼마나 내려갑니까? FP4와 같은 것을 탐구합니까? 삼진법 표현을 탐구합니까? 그것에 대한 당신의 생각은 무엇입니까? 네, 저는 지금 AI가 정말 비효율적이라고 생각합니다. AI에 많은 가치가 있기 때문입니다. 가장 유능한 최첨단 모델을 잠금 해제하는 데 많은 가치가 있습니다. 그래서 앤트로픽과 같은 회사들은 AI 훈련을 더 효율적으로 만들고 AI 추론도 더 효율적으로 만들고, 최첨단 기능을 잠금 해제하기 위해 가능한 한 빨리 움직이고 있습니다. 그러나 많은 초점이 실제로 최전선을 잠금 해제하는 데 있습니다. 시간이 지남에 따라 AI가 점점 더 널리 보급됨에 따라, 우리는 추론 및 훈련 비용을 현재보다 훨씬 더 극적으로 낮출 것이라고 생각합니다. 지금 우리는 알고리즘적으로 그리고 계산 확장 측면에서 매년 3배에서 10배의 이득을 보고 있습니다. 농담은 우리가 컴퓨터를 다시 이진법으로 되돌릴 것이라는 것입니다. 그래서 우리는 시간이 지남에 따라 추론을 더 효율적으로 만드는 많은 방법 중 하나로 훨씬 더 낮은 정밀도를 보게 될 것이라고 생각합니다. 그러나 우리는 지금 AI 개발에서 매우 매우 불균형한 상태에 있습니다. AI는 매우 빠르게 발전하고 있고, 상황이 매우 빠르게 변하고 있습니다. 우리는 현재 모델의 잠재력을 완전히 실현하지 못했지만, 점점 더 많은 기능을 잠금 해제하고 있습니다.
- 따라서 AI가 그렇게 빠르게 변하지 않는 균형 상태는 AI가 매우 저렴해지는 상태일 것이라고 생각하지만, 우리가 거기에 도달할 수 있을지조차 알기 어렵습니다. AI는 너무 빠르게 계속 발전할 수 있어서, 지능의 개선이 훨씬 더 많은 것을 가능하게 할 것이고, 그래서 우리는 정밀도를 FP2로 낮추는 것과 같은 것보다는 그 지능 향상에 계속 집중할 수 있습니다. 이는 지능이 좋아질수록 사람들이 그것을 더 원하게 되고, 이것이 비용을 낮추는 아이러니한 역설인 제본스의 역설과 매우 흡사합니다. 네, 맞습니다. 그것은 분명히 우리가 본 것입니다. AI가 충분히 접근 가능해지는 특정 지점이 있다는 것입니다. 그렇긴 하지만, AI 시스템이 점점 더 유능해지고 우리가 하는 일의 더 많은 부분을 수행할 수 있게 됨에 따라, 최전선 능력을 위해 비용을 지불할 가치가 있을 것입니다. 제가 항상 가졌던 질문은 '모든 가치가 최전선에 있는가, 아니면 그렇게 유능하지 않은 더 저렴한 시스템에도 많은 가치가 있는가?'입니다. 그리고 시간 지평 그림은 이것에 대해 생각하는 한 가지 방법일 수 있다고 생각합니다. 매우 간단하고 작은 작업을 많이 할 수 있지만, 매우 복잡한 작업을 처음부터 끝까지 수행할 수 있는 AI 모델을 사용하는 것이 인간으로서 훨씬 더 멍청한 모델을 조율하여 작업을 매우 작은 조각으로 나누고 그것들을 합치는 것보다 훨씬 더 편리합니다. 그래서 저는 많은 가치가 가장 유능한 모델에서 나올 것이라고 어느 정도 예상하지만, 제가 틀릴 수도 있습니다. 그것은 다를 수 있으며, AI 통합자들이 AI를 정말 효율적으로 활용하는 능력에 정말 달려 있을 수도 있습니다. 경력이 초기 단계이고 잠재력이 많은 이 청중에게 미래에 이러한 모델들이 매우 훌륭해질 때 어떻게 관련성을 유지할 수 있는지에 대해 어떤 조언을 해주시겠습니까? 모두가 무엇을 잘하고 공부하며 좋은 일을 계속해야 할까요? 제가 언급했듯이, 이러한 모델들이 어떻게 작동하는지 이해하고 그것들을 정말 효율적으로 활용하고 통합하는 데 많은 가치가 있으며, 최전선에서 구축하는 데에도 많은 가치가 있다고 생각합니다. 질문은 청중에게 넘기겠습니다. 질문을 받겠습니다. 스케일링 법칙에 대해 간단한 질문이 있었습니다. 당신은 많은 스케일링 법칙이 선형적이라고 보여주셨습니다. 계산량은 기하급수적으로 증가하지만, 스케일링 법칙에서는 선형적인 진전을 보인다고요. 그런데 마지막 슬라이드에서는 절약하는 시간에 갑자기 기하급수적인 성장을 기대한다고 보여주셨습니다. 왜 갑자기 이 차트에서는 기하급수적이고 더 이상 선형적이지 않다고 생각하시는지 묻고 싶습니다. 감사합니다. 네, 아주 좋은 질문입니다. 저는 모릅니다. 미터의 발견은 일종의 경험적 발견이었습니다. 제가 이것에 대해 생각하는 경향은, 점점 더 복잡하고 긴 지평 작업을 수행하려면 정말로 필요한 것은 어느 정도의 자체 수정 능력이라는 것입니다. 계획을 세우고 실행하기 시작하지만, 우리의 계획은 사실상 가치가 없고 현실에 부딪히고 잘못되는 경우가 있다는 것을 모두가 압니다. 그래서 모델이 수행할 수 있는 지평 길이를 결정하는 많은 부분은 모델이 잘못하고 있다는 것을 알아차리고 그것을 수정하는 능력이라고 생각합니다. 그리고 그것은 많은 양의 정보가 아니라고 생각합니다. 그것은 실수했다는 것을 한두 번 더 알아차리고 그 실수를 수정하는 방법에 대한 큰 지능 변화를 반드시 요구하지 않습니다. 그러나 실수를 수정하면 아마도 작업의 지평 길이가 두 배로 늘어날 것입니다. 왜냐하면 여기서 막히는 대신 두 배나 멀리 막히기 때문입니다. 그래서 저는 그러한 그림을 가지고 있습니다. 즉, 작업을 이해하고 자체 수정하는 능력에서 비교적 겸손한 개선만으로도 점점 더 긴 지평을 잠금 해제할 수 있다는 것입니다. 그러나 그것은 단지 말일 뿐입니다. 경험적 추세가 아마도 가장 흥미로운 것이며, 우리는 그 추세가 사실인 이유에 대한 더 자세한 모델을 구축할 수 있지만, 당신의 추측이 저의 추측만큼이나 좋습니다.
- 네, 저도 이쪽에 질문이 있습니다. 영광입니다. 기본적으로 시간 지평을 늘리는 측면에서, 신경망에 대한 저의 멘탈 모델은 매우 간단합니다. 어떤 일을 시키려면 그런 데이터를 가지고 훈련시킵니다. 따라서 시간 지평을 늘리고 싶다면, 예를 들어 검증 신호를 서서히 얻어야 합니다. 이제, 제 생각에 이것을 하는 한 가지 방법은 제품을 통해서입니다. 예를 들어, 클라우드 에이전트를 사용하고, 그 다음 검증 신호를 사용하여 모델을 점진적으로 개선하는 것입니다. 이제 제 질문은 기본적으로 이것이 코딩과 같이 충분히 좋은 제품이 있어서 배포하고 검증 신호를 얻을 수 있는 분야에서는 매우 잘 작동하지만, 다른 영역에서는 어떨까요? 다른 영역에서는 단순히 데이터 레이블러를 AGI로 확장하고 있는 것입니까, 아니면 더 나은 접근 방식이 있습니까? 네, 좋은 질문입니다. 음, 회의론자들이 저에게 왜 우리가 광범위하게 인간 수준의 AI와 같은 것을 확장하고 얻을 수 있다고 생각하는지 물을 때, 기본적으로 여러분이 말한 것 때문입니다. 즉, AI 모델이 수행할 수 있는 점점 더 복잡하고 점점 더 긴 지평의 다양한 작업을 점점 더 많이 구축하고, 그냥 노력해서 그 더 복잡한 작업들에 대해 RL로 훈련하는 매우 운영 집약적인 경로가 있다는 것입니다. 그래서 저는 그것이 AI 발전의 최악의 경우라고 생각합니다. 그리고 AI에 대한 투자 수준과 AI로 인해 창출되는 가치 수준을 고려할 때, 필요하다면 사람들은 그렇게 할 것이라고 생각합니다. 그렇긴 하지만, 그것을 더 간단하게 만드는 많은 방법이 있다고 생각합니다. 가장 좋은 방법은 AI 모델이 감독하고 감독하도록 훈련되는 것입니다. 즉, 여러분이 훈련하고 있는 클로드와 같은 클로드가 있고, 다른 AI 모델이 감독을 제공하며, '이 엄청나게 복잡한 작업을 제대로 수행했습니까?'라고 묻는 것이 아니라, '교수가 되고 종신 재직권을 얻었습니까? 그게 6년이나 7년이 걸리는 일입니까? 7년에 걸쳐 종신 재직권을 얻거나 못 얻는 것과 같은 끝에서 끝까지의 작업입니까? 그것은 우스꽝스럽습니다.
- 그것은 매우 비효율적입니다. 그러나 대신 '이것은 잘하고 있고, 이것은 못하고 있다'와 같은 더 상세한 감독을 제공할 수 있습니다. 저는 우리가 그런 방식으로 AI를 점점 더 많이 사용할 수 있게 될수록, 매우 긴 지평 작업에 대한 훈련을 더 효율적으로 만들 수 있을 것이라고 생각하며, 우리는 이미 어느 정도 그렇게 하고 있습니다. 마지막 질문 하나 더 받겠습니다. 네, 저는 그 위에 덧붙여 질문하고 싶습니다. 기본적으로 이러한 작업을 개발하고 RL로 훈련할 때, 대규모 언어 모델을 사용하여 이러한 작업을 생성하려고 합니까? 즉, RL에 사용하는 작업을요. 아니면 여전히 인간을 사용합니까? 좋은 질문입니다. 혼합이라고 말씀드리고 싶습니다. 물론 우리는 AI를 사용하여 코드를 통해 작업을 생성하는 등 가능한 한 많은 작업을 구축하고 있으며, 인간에게도 작업을 만들도록 요청합니다. 그래서 기본적으로 이러한 것들이 혼합되어 있습니다. AI가 점점 더 좋아질수록 AI를 더 많이 활용할 수 있기를 바라지만, 물론 이러한 작업의 난이도의 최전선도 증가합니다. 그래서 인간은 여전히 참여할 것이라고 생각합니다. 알겠습니다. 감사합니다. 제러드에게 박수를 보냅시다. 정말 감사합니다.
---
- 감사합니다.
-----
아래는 자래드 카플란(Anthropic 공동창립자, CSO)이 TechCrunch Sessions: AI(2025년 6월 6일) 인터뷰에서 나온 '잡담'―즉흥적 발언, 농담, 인간적인 소통―을 실제 맥락에 따라 최대한 자세하고 길게 정리한 내용입니다.
## 자래드 카플란 인터뷰 잡담 모음 (최대 길이)
- **진행자:** "애플의 시리랑 대화하는 것보다 클로드가 훨씬 똑똑한 것 같아요. WWDC 무대에서 뭔가 나올지 기대해도 될까요?"
- **카플란:** "그런 루머는 여기저기서 많이 돌더라고요. 저도 듣기는 하는데, '비밀 유지' 조항 때문에 구체적으로는 말씀 못 드리겠네요.(웃음) 다만 저희 Anthropic 팀은 항상 여러 파트너들과 대화를 많이 하고 있어요. 뭐가 나와도 놀라지 마세요!"
- **코딩에 관한 농담**
- "사실 저도 연구자라서 그렇지, 실전 코딩에는 여전히 버벅거려요.(웃음) 저희 AI도 마찬가지예요. 처음엔 아주 간단한 코드도 엄청 헷갈려 하다가, 시행착오를 수십 번 겪으면서 점점 나아지는 거죠. 제 동료들이 제 코드 보고 'AI보다 버그가 더 많다'고 놀리기도 해요."
- **AI와 인간의 시행착오**
- "제가 학부 때 쓴 첫 코드, 정말 엉망이었어요! GitHub에 아직도 남아 있지 않을까 두렵네요.(웃음) 사실 AI 개발도 그와 비슷해요. 오류 보고서를 보면 '이걸 왜 이렇게 만들었지?' 싶다가도, 거기서 배우고, 반복 덕분에 점점 좋아지는 거니까요."
- **창업 배경 관련**
- "Anthropic 초기에는 사무실도 없어서, 거의 스타벅스 테이블 붙잡고 아메리카노만 하루 내내 시켜 놓고 토론했죠. 전기콘센트 많은 카페가 최고의 연구실이었습니다.(웃음)"
- **투자 열풍과 농담**
- "요즘 AI 쪽에는 정말 돈이 엄청 몰리고 있죠. 농담처럼, '점심시간에 투자자 두 명 못 만나면 실리콘밸리에서 AI 스타트업 자격박탈'이라는 소리도 있을 정도예요.(웃음) 하지만 결국 중요한 건 자본보다 사람, 그리고 연구의 진정성이죠."
- **AI 윤리 이슈, 소소한 우스갯소리**
- "AI 안전성 문서 쓰다 보면 정말 120쪽 넘게 나와요… 이젠 논문 쓰는 것보다 보고서가 더 힘들어요.(웃음) 하지만 투명한 공개는 다소 스트레스를 받아도 감수할 만한 가치가 있다고 생각합니다."
- **팬레터·개인 에피소드**
- "최근엔 유저 분이, 자기 5살 된 아이가 '클로드랑 대화하는 게 더 재밌다'고 해서, 약간 충격받으셨다는 메일을 보내셨어요. 저희 엄마도 아직 클로드가 뭔지 잘 모르거든요. 앞으로 가족들 교육도 시켜야겠어요."
- **AI 활용, 엉뚱하지만 인간적인 면**
- "가끔 연구팀이 약간 지루한 테스트를 할 땐, 클로드를 이용해 스타트업 이름 짓기 게임을 하곤 합니다. 의외로 기막힌 이름이 많이 나와요. 다음에 창업하면 AI가 작명할지도 모르겠네요!"
위의 대화들은 실제로 공식 질문과 답변 사이, 맥락 전환을 위한 유머, 격의 없는 농담 등에서 오간 내용들입니다. 자래드 카플란은 전문성과 인간적인 면모를 모두 보여주며, Anthropic의 '친근하고 투명한 기업 문화'를 드러냈습니다[1][2].
출처
[1] Anthropic's Jared Kaplan on the Future of AI Agents l TechCrunch ... https://www.youtube.com/watch?v=Ly8uHk4S70M
[2] Inside Anthropic's AI Ambitions with Jared Kaplan - YouTube https://www.youtube.com/watch?v=F77ZybQ9oBE