카테고리 없음

GPT5 코덱스 출시 이후 사용률은 폭발적으로 증가하여 사용자 전반에 걸쳐 10배 이상 성장

클로vㅏ 컴퓨터 2025. 9. 23. 23:55

https://youtu.be/OXOypK7_90c?si=az_wtN4ckNQ5lqIX

Codex and the future of coding with AI — the OpenAI Podcast Ep. 6

What happens when AI becomes a true coding collaborator? OpenAI co-founder Greg Brockman and Codex engineering lead Thibault Sottiaux talk about the evolutio...

www.youtube.com



- - 안녕하세요, 저는 앤드류 메인이며, 이곳은 OpenAI 팟캐스트입니다. 이번 에피소드에서는 OpenAI 공동 창립자이자 사장인 그렉 브록만과 Codex 엔지니어링 리드인 티보 소티오와 이야기 나눌 것입니다.

- - 그리고 우리는 어젠다 코딩, GPT-5 코덱스, 그리고 2030년에 상황이 어떻게 전개될지에 대해 이야기할 것입니다. 장기적으로는 더 뛰어난 지능이 결국 성공할 것이라고 확신합니다. 이것은 사람들이 코덱스 내에서 GPT-5를 사용하는 용도에 정말 최적화되어 있습니다.

- - 어떻게 AI가 실제로 정확한 것을 생성하도록 보장할 수 있을까요? 저희는 코덱스에 대해 이야기하기 위해 이곳에 왔습니다. 저는 실제로 여기에서 일할 때 첫 버전부터 사용해 왔습니다. 그리고 이제 여러분들은 이 새로운 버전을 가지고 있습니다. 저는 주말 내내 이것을 사용해 보았고 매우, 매우 깊은 인상을 받았습니다. 이 기술이 몇 년 만에 이렇게 발전했다는 것이 놀랍습니다. 초기 이야기가 궁금합니다.

- - 언어 모델을 코딩에 사용한다는 아이디어는 어디서 나왔을까요? 음, 저는 GPT-3 시절에, 함수 이름의 파이썬 정의인 독스트링(doc string)을 입력하고 모델이 코드를 완성하는 아주 첫 번째 생명의 징후를 보았던 것을 기억합니다. 그것을 보자마자, 이것이 성공할 것이라는 것을 알았습니다. 이것은 큰일이 될 것입니다.

- - 그리고 저는 우리가 '언어 모델이 일관성 있는 코드 천 줄을 작성할 수 있다고 상상해 보라'는 열망적인 목표에 대해 이야기했던 순간을 기억합니다. 그것은 우리에게 큰 목표였습니다. 그리고 정말 놀라운 것은 그 목표가 이미 지나갔다는 것입니다. 우리는 그것에 대해 두 번 생각하지 않는 것 같습니다. 이 기술을 개발하는 동안에는 실제로 구멍, 결함, 작동하지 않는 것들만 보게 되는 것 같습니다.

- - 그러나 때때로 한 걸음 물러나서 실제로 상황이 얼마나 발전했는지 깨닫는 것이 좋습니다. 우리는 항상 개선되는 것에 얼마나 익숙해지는지, 그리고 그것이 매일 사용하는 도구(daily driver)가 되는 것이 얼마나 놀라운지 말입니다. 매일 사용하다가 한 달 전을 되돌아보면, 이것은 가능하지도 않았습니다. 그리고 이것은 계속해서 일어나고 있습니다. 인간이 새로운 것에 얼마나 빨리 적응하는지 정말 매혹적인 것 같습니다.

- - 이제 우리가 항상 겪었던 어려움 중 하나는 특정 영역에 깊이 파고들 것인지에 대한 질문입니다. 왜냐하면 우리는 AGI, 즉 일반 지능을 위해 여기에 왔기 때문입니다. 그래서 일차적으로 우리의 본능은 모든 기능을 한 번에 더 좋게 만드는 데 집중하는 것입니다. 코딩은 항상 그 예외였습니다.

- - 우리는 코딩 데이터, 코드 지표에 집중하고, 우리 모델이 코드에서 어떻게 작동하는지 실제로 이해하려고 노력하는 매우 다른 프로그램을 가지고 있습니다. 그리고 우리는 다른 영역에서도 그렇게 하기 시작했습니다. 그러나 프로그래밍과 코딩의 경우, 이는 우리에게 매우 예외적인 초점이었습니다.

- - 그리고 GPT-4의 경우, 우리는 모든 면에서 도약한 단일 모델을 실제로 생산했습니다. 하지만 우리는 실제로 코덱스 모델을 훈련했습니다. 그리고 저는 파이썬에 초점을 맞춘 모델을 만들었던 것을 기억합니다. 우리는 2021년경에 코딩 능력 수준을 정말, 정말 높이려고 노력하고 있었습니다.

- - 그리고 저는 우리가 코덱스 데모를 했을 때, 그것이 오늘날 우리가 바이브 코딩(Vibe coding)이라고 부르는 것의 첫 번째 시연이었을 수도 있다는 것을 기억합니다. 저는 이 인터페이스를 구축하면서 일반적인 언어 모델 작업의 경우 인터페이스나 하네스(harness)가 매우 간단하다는 것을 깨달았습니다. 그냥 무언가를 완성하는 것이고, 아마 후속 턴이 있을 수도 있지만 그게 전부입니다.

- - 코딩의 경우, 이 텍스트가 실제로 살아 움직입니다. 그것을 실행해야 하고 도구에 연결되어야 하며 이 모든 것들이 필요합니다. 그래서 여러분은 하네스가 지능만큼이나 이 모델을 유용하게 만드는 데 거의 동등한 부분이라는 것을 깨닫게 됩니다.

- - 그리고 이것은 우리가 그 순간부터 알고 있었다고 생각하는 것입니다. 그리고 올해 우리가 더 유능한 모델을 갖게 되면서, 그리고 원초적인 능력(raw capability), 예를 들어 프로그래밍 대회에서 어떻게 이기는가가 아니라 어떻게 그것을 유용하게 만들지에 정말 집중하기 시작하면서, 다양한 환경에서 훈련하고, 사람들이 그것을 어떻게 사용할지에 실제로 연결하고, 그리고 티보와 그의 팀이 정말 열심히 추진해 온 하네스를 실제로 구축하는 것을 보는 것이 흥미로웠습니다.

- - 간단한 용어로 하네스가 무엇을 의미하는지 설명해 주시겠습니까? 네, 아주 간단합니다. 모델이 있고, 모델은 단순히 입력-출력이 가능합니다. 그리고 우리가 하네스라고 부르는 것은 모델이 실제로 환경에서 작동할 수 있도록 나머지 인프라와 통합하는 방법입니다. 따라서 이는 일련의 도구이고, 루프 방식입니다. 우리가 에이전트 루프라고 부르는 에이전트 루프입니다.

- - 그리고 본질적으로는 상당히 간단합니다. 하지만 이러한 조각들을 함께 통합하고 실제로 엔드투엔드(end to end)로 훈련하기 시작하면, 상당히 마법 같은 행동과 모델이 여러분을 대신하여 실제로 행동하고 무언가를 창조할 수 있는 능력을 보기 시작하며, 진정한 협력자가 됩니다. 그러니 하네스는 여러분의 몸이고 모델은 여러분의 뇌라고 생각하시면 됩니다.

- - 알겠습니다. GPT-3 시절에는 주석 처리된 코드를 작성하고 "이 함수는 파이썬에서 이런 일을 한다"고 말하고, 앞에 해시태그를 붙이는 등 문자 그대로 해야 했던 때부터 얼마나 발전했는지 보는 것은 흥미롭습니다. 그리고 이제 모델들이 코딩에 자연스럽고 직관적으로 능숙해졌다는 것을 보는 것은 흥미롭습니다. 그리고 일반적인 목적의 모델과 코드가 얼마나 중요한지를 결정하는 것에 대해 언급하셨습니다.

- - 단순히 외부 수요였습니까, 사람들이 이 모델 중 하나가 코드에 더 능숙하다고 말했습니까? 아니면 여러분들이 이것을 더 많이 사용하고 싶었기 때문에 내부적으로 나온 것입니까? 둘 다입니다. 네, 전적으로 둘 다입니다. 그리고 저는 2022년에 GitHub과 협력하여 GitHub Copilot을 만들었을 때를 기억합니다. 거기서 매우 흥미로웠던 점은, 코딩 워크플로우 중간에 AI가 있다는 것이 어떤 느낌인지, 그리고 그것이 여러분을 어떻게 가속화할 수 있는지를 처음으로 실제로 느꼈다는 것입니다.

- - 그리고 저는 정확히 올바른 인터페이스에 대한 많은 질문이 있었다는 것을 기억합니다. 고스트 텍스트를 원하십니까? 그래서 그것이 단순히 완성을 하는 것입니까? 다양한 가능성을 가진 작은 드롭다운을 원하십니까? 그러나 한 가지 매우 분명했던 것은 지연 시간(latency)이 제품의 특징이었다는 것입니다.

- - 그리고 자동 완성(autocomplete)과 같은 것에 대한 제약은 1500밀리초입니다. 그것이 여러분이 완성을 만들어야 하는 시간입니다. 그보다 느린 것은 아무리 훌륭하더라도 아무도 그것을 기다리고 싶어하지 않습니다. 그래서 우리가 가지고 있던 의무, 사용자 및 제품 관리자, 그리고 제품 측면을 생각하는 모든 사람들로부터 받은 명확한 신호는 지연 시간 제약 조건 내에서 가장 똑똑한 모델을 얻으라는 것이었습니다.

- - 그리고 GPT-4와 같은 것이 있습니다. 훨씬, 훨씬 더 똑똑하지만, 지연 시간 예산을 충족하지 못할 것입니다. 어떻게 해야 할까요? 쓸모없는 모델일까요? 절대 그렇지 않습니다. 여러분이 해야 할 일은 하네스를 바꾸고 인터페이스를 바꾸는 것입니다. 그리고 저는 그것이 정말 중요한 주제라고 생각합니다. 인터페이스와 모델을 사용하는 방식을 모델의 특성에 맞게 공동 발전시켜야 합니다.

- - 그래서 초고속, 스마트 모델은 훌륭할 것이지만, 매우 똑똑하지만 느린 모델 또한 가치가 있습니다. 그리고 저는 우리가 항상 그 지능에 대한 수익은 가치가 있다는 가설(thesis)을 가지고 있었다고 생각합니다. 그리고 그 순간에는 명확하지 않습니다. 왜냐하면 '음, 너무 느릴 거야. 누가 그것을 사용하고 싶어할까?'라고 생각하기 때문입니다. 하지만 저는 우리의 접근 방식이 더 큰 지능이 장기적으로 성공할 것이라고 말하는 것이었다고 생각합니다.

- - GitHub Copilot 작업을 할 때 그것이 어디로 향하고 있는지 이해하기 어려웠습니다. 왜냐하면 그 시점에서는 말씀하셨듯이 완성, 무언가를 하라고 요청하면 무언가를 완성하는 것에 익숙했기 때문입니다.

- - 그리고 저는 하네스를 구축하고 거기에 모든 기능을 추가하는 것에서 얼마나 더 많은 가치를 얻을 수 있는지 실제로 이해하지 못했습니다. 그리고 모델만 있으면 된다고 생각했지만, 이제 도구(tooling), 다른 모든 것이 큰 차이를 만들 수 있다는 것을 깨닫습니다.

- - 그리고 당신은 양상(modality)이라는 아이디어를 언급했습니다. 이제 우리는 CLI, Codex CLI를 가지고 있습니다. 그래서 저는 명령줄에서 들어가 이것을 할 수 있습니다. VS Code용 플러그인이 있으므로 거기에서 이것을 사용할 수 있습니다. 그리고 또한 웹에 배포하고 그것을 할 수 있습니다.

- - 그리고 저는 그것의 가치를 완전히 이해하지 못하는 것 같습니다. 그래서 이것을 어떻게 사용하고 있습니까? 이러한 것들을 어떻게 직접 배포하고 있습니까? 어디에서 가장 큰 유용성을 찾고 있습니까?

- - 저는 조금 되돌아가서, 우리가 본 첫 번째 징후는 회사 내부 및 외부의 많은 개발자들, 즉 우리의 사용자들이 ChatGPT를 사용하여 매우 복잡한 문제를 디버깅하는 데 도움을 받는 것을 보았다는 것입니다. 그리고 우리가 명확하게 본 한 가지는 사람들이 ChatGPT에 점점 더 많은 맥락을 넣으려고 노력한다는 것입니다. 그리고 여러분은 코드 조각과 스택 추적 등을 가져오려고 합니다. 그리고 그것을 붙여넣고 매우 똑똑한 모델에 제시하여 도움을 받습니다.

- - 그리고 상호 작용은 점점 더 복잡해지기 시작했고, 우리는 '사용자가 이 일을 주도하는 대신, 모델이 실제로 상호 작용을 주도하고 자체 맥락을 찾고, 그리고 혼자서 이 어려운 문제를 디버깅할 수 있는 방법을 찾도록 하자'는 것을 깨달았습니다. 그래서 여러분은 앉아서 모델이 작업을 하는 것을 지켜볼 수 있습니다.

- - 그래서 이것은 상호 작용을 역전시키는 것과 같으며, 하네스에 대해 훨씬 더 많이 생각하고 모델에 행동할 수 있는 능력을 부여하는 것으로 이어졌습니다. 그리고 우리는 형태 인자(form factors)를 반복했습니다. 저는 올해 초에 우리가 몇 가지 다른 접근 방식을 가지고 있었던 것을 기억합니다. 우리는 비동기 에이전트 하네스뿐만 아니라 로컬 경험과 그것의 몇 가지 다른 구현도 가지고 있었습니다.

- - 우리는 실제로 터미널에서 이것을 실행하는 아이디어를 가지고 조금 실험하기 시작했습니다. 그리고 나서 우리는 그것이 AGI(일반 인공지능)의 개념을 충분히 담고 있지 않다고 느꼈습니다. 우리는 이것을 대규모로, 그리고 원격으로 실행하고 노트북을 닫고 에이전트가 계속 작업을 수행할 수 있는 능력이 필요했습니다. 그리고 나서 여러분은 아마도 휴대폰으로 그것을 따라가고 거기에서 상호 작용할 수 있습니다. 그것은 매우 멋져 보였습니다. 그래서 우리는 그것을 추진했습니다.

- - 그러나 우리는 실제로 터미널에서 완전히 작동하는 프로토타입을 가지고 있었습니다. 그리고 OpenAI의 사람들은 그것을 생산적으로 사용하고 있었습니다. 우리는 이것을 제품으로 출시하지 않기로 결정했습니다. 그것이 충분히 세련되었다고 느껴지지 않았습니다.

- - 우리는 그것이 10배의 생산성 향상을 제공한다고 느꼈기 때문에 10X라고 불렀습니다. 하지만 우리는 다른 형태 인자들을 실험하고 처음에 비동기 형태 인자에 전념하기로 결정했습니다.

- - 그리고 이제 우리는 그것으로부터 조금 되돌아와서 재진화했으며, '이 에이전트를 실제로 여러분의 터미널로 다시 가져올 수 있습니다. 여러분의 IDE로 가져올 수 있습니다.'라고 말했습니다. 그러나 우리가 정말로 올바르게 하려고 노력하는 것은 이 엔티티, 즉 여러분과 함께 일하는 이 협력자를 개발자들이 이미 사용하고 있는 도구로 가져오는 것입니다.

- - 그리고 다른 시도들도 있었습니다. 그래서 우리는 로컬 에이전트에 연결되는 원격 데몬(daemon)이 있는 버전을 가지고 있었습니다. 그래서 여러분은 한 번에 둘 다를 얻을 수 있었습니다. 그리고 저는 진화의 일부는 도구를 배포하려고 시도할 수 있는 다양한 방법의 매트릭스(matrix)가 거의 있다는 것이었다고 생각합니다.

- - 클라우드에 자체 컴퓨터를 가진 비동기적인 방식이 있습니다. 동기적으로 실행되는 로컬 방식이 있습니다. 여러분은 이것들을 혼합할 수 있습니다. 사람들의 다양한 환경에서 유용한 외부화할 수 있는 것을 구축하는 데 얼마나 집중할 것인지, 아니면 우리 자신의 환경에 정말 집중하고 내부 엔지니어들에게 상황이 정말 잘 작동하도록 노력할 것인지에 대한 질문이 있었습니다.

- - 그리고 어려움 중 하나는 우리가 이 모든 것을 하고 싶다는 것이었습니다. 궁극적으로 우리는 모든 사람에게 유용한 도구를 원합니다. 하지만 자신에게조차 유용하게 만들 수 없다면, 어떻게 다른 모든 사람에게 매우 유용하게 만들 수 있을까요? 그래서 우리에게 주어진 과제의 일부는 어디에 집중하고 엔지니어링 노력 측면에서 가장 큰 효과를 어떻게 달성할지 실제로 파악하는 것이었습니다.

- - 그리고 저에게 있어서 가장 중요한 초점 중 하나는 코딩 및 매우 유능한 에이전트를 구축하는 것이 올해 우리가 할 수 있는 가장 중요한 일 중 하나라는 것을 알고 있다는 것입니다. 올해 초에 우리는 연말까지 에이전트 소프트웨어 엔지니어라는 회사 목표를 설정했습니다. 그리고 그것이 정확히 무엇을 의미하는지, 그리고 그것을 어떻게 실현하고, 이 문제에 적용할 수 있는 모든 기회와 모든 종류의 컴퓨팅을 어떻게 통합할지 파악하는 것은 OpenAI의 많은 사람들에게 큰 과제였습니다.

- - 그래서 당신은 10X라는 도구를 가지고 있었고, 그것은 내부 도구였습니다. 그리고 그것은 어느 시점에서 '아, 이것이 다른 사람들에게 정말 유용하겠구나'라고 말한 것이었을 것입니다. 언제 그렇게 하고 언제 하지 않을지 결정하는 것은 어려울 것입니다. 그리고 그것을 얼마나 우선순위를 정할지 말입니다.

- - 클라우드 코드가 매우 강력해지는 것을 보았는데, 이는 아마도 내부적으로 사용되다가 배포된 것과 비슷한 이야기일 것입니다. 다음 단계를 생각하기 시작할 때, 다음에 어디로 가져갈지 결정합니까? 어디에 중점을 둘지 결정합니까?

- - 이전에 클라우드에서 무언가를 실행하고, 이와 같은 에이전트적인 작업을 수행할 수 있다고 언급하셨는데, 제가 자리를 비워도 됩니다. 그리고 저의 문제는 이것이 너무 새로운 양상이라는 것입니다. 생각하기가 정말, 정말 어렵습니다. 하지만 때로는 이러한 것들이 잠시 동안 그대로 있다가 사람들이 독립적으로 그것을 발견해야 합니다. 그리고 내부적으로 '아, 이제 알겠다'라고 말하는 사람을 발견했습니까?

- - 저는 전적으로 그렇다고 말하고 싶습니다. 그리고 저는 저의 관점은 우리가 장기적인 미래의 형태를 알고 있다는 것입니다. AI가 자체 컴퓨터를 가지고, 에이전트 집단에 위임하고, 여러 작업을 병렬로 해결할 수 있기를 원한다는 것은 매우 분명합니다. 여러분은 아침에 일어나 커피를 마시며 에이전트에게 질문에 답하고, 일부 검토를 제공하며, '아, 이것이 제가 의도한 바가 아닙니다'라고 말하는 등의 작업을 하게 될 것입니다. 이 워크플로우는 분명히 일어나야 합니다.

- - 그러나 모델들이 여러분이 그들과 상호 작용하는 방식이 될 만큼 충분히 똑똑하지는 않습니다. 그래서 여러분이 작업을 수행하는 방식과 매우 유사하게 보이는 방식으로 여러분의 터미널과 편집기에 실제로 존재하는 에이전트를 갖는 것이 현재이기도 합니다.

- - 그래서 저는 우리가 그것을 보는 방식은 '미래가 어떤 모습인지'와 '현재를 포기할 수 없다'는 것을 거의 흐릿하게 섞는 것이라고 생각합니다. 그리고 AI를 코드 검토에 어떻게 도입하고, 그것이 선제적으로 나타나서 여러분에게 유용한 작업을 수행하도록 만들 수 있는지 생각하는 것입니다.

- - 그리고 나서 여러분은 훨씬 더 많은 PR을 가지고 있다면, 실제로 병합하고 싶은 PR들을 어떻게 분류할 것인가에 대한 완전히 새로운 과제를 갖게 됩니다. 그래서 저는 우리가 이 모든 기회 영역을 보았고, 사람들이 OpenAI 내에서 개발하는 방식을, 심지어 코드 기반을 구성하는 방식까지 바꾸기 시작했다는 것을 보았습니다.

- - 네, 그 효과에 기여하는 두 가지가 있다고 생각합니다. 그리고 그것이 우리가 오늘날 있는 곳을 의미합니다. 하나는 인프라가 어렵다는 것입니다. 그리고 우리는 모든 사람의 코드와 작업, 패키지가 완벽하게 컨테이너화될 수 있기를 바랍니다. 그래서 우리는 그것들을 대규모로 실행할 수 있습니다. 그렇지 않습니다.

- - 사람들은 아마도 자신의 노트북에서만 실행되는 매우 철저하고 복잡한 설정을 가지고 있습니다. 그리고 우리는 그것을 활용하고 사람들이 있는 곳에서 만날 수 있기를 바랍니다. 그래서 그들이 코덱스를 위해 특별히 환경을 구성할 필요가 없습니다. 그것은 매우 강력한 코딩 에이전트가 여러분을 위해 무엇을 할 수 있는지 경험할 수 있는 매우 쉬운 진입점을 제공합니다.

- - 그리고 동시에 그것은 우리가 올바른 인터페이스가 무엇인지 실험할 수 있게 해줍니다. 6개월 전에는 이러한 종류의 도구를 사용하지 않았습니다. 그리고 이 모든 것은 매우 새롭고 빠르게 진화하고 있습니다. 그리고 우리는 여기서 계속 반복하고 이러한 에이전트와 협력하는 올바른 인터페이스와 방식이 무엇인지 혁신해야 합니다.

- - 그리고 우리는 아직 그것을 완전히 파악했다고 느끼지 않습니다. 그것은 계속 진화할 것입니다. 하지만 그것을 제로 설정(zero setup), 상자에서 꺼내자마자 사용하기 매우 쉬운 상태로 가져오는 것은 훨씬 더 많은 사람들이 그것으로부터 혜택을 받고 그것을 가지고 놀 수 있도록 허용합니다. 그리고 우리가 계속 혁신할 수 있도록 피드백을 얻는 것이 매우 중요합니다.

- - 저는 올해 초에 우리 엔지니어 중 한 명과 이야기했던 것을 기억합니다. 그는 정말 훌륭하다고 생각합니다. 그리고 그는 ChatGPT가 이 터미널에서 자동으로 맥락을 볼 수 있는 통합 기능이 있었다고 말했습니다. 그리고 그는 그것이 혁신적이라고 말했습니다. 왜냐하면 그는 오류를 복사하여 붙여넣을 필요가 없기 때문입니다. 그는 즉시 '이봐, 버그가 뭐야?'라고 말할 수 있었고, 그것은 그에게 알려주었으며 그것은 훌륭했습니다.

- - 그리고 여러분은 우리가 구축한 통합 기능이 너무나 혁신적이라는 것을 깨닫습니다. 그것은 더 똑똑한 모델에 관한 것이 아니었습니다. 그리고 저는 혼동하기 매우 쉬운 한 가지는 이러한 차원 중 하나에만 초점을 맞추고 '어떤 것이 중요합니까?'라고 생각하는 것이라고 생각합니다. 왜냐하면 대답은 둘 다 중요하기 때문입니다.

- - 제가 항상 이것에 대해 생각했던 방식은, 2020년에 API를 처음 출시했을 때를 기억합니다. AI를 바람직하게 만드는 두 가지 차원이 있습니다. 지능이 있고, 그것을 하나의 축으로 생각할 수 있습니다. 그리고 편의성(convenience)이 있습니다. 이것은 지연 시간으로 생각할 수 있습니다. 비용으로 생각할 수 있습니다. 또는 사용할 수 있는 통합 기능으로 생각할 수 있습니다.

- - 그리고 일부 수용 영역(acceptance region)이 있습니다. 모델이 엄청나게 똑똑하지만, 그것을 실행하는 데 한 달이 걸린다고 가정해 봅시다. 그래도 사용할 수도 있습니다. 출력물이 매우 가치 있는 코드 조각이거나 특정 질병의 치료법이라면 괜찮습니다. 가치가 있습니다.

- - 모델이 그렇게 지능적이지 않고 유능하지 않다면, 여러분이 원하는 것은 자동 완성뿐입니다. 따라서 그것은 엄청나게 편리해야 하며, 그것이 제안하는 것에 대해 생각하는 데 인지적 부담(cognitive tax)이 전혀 없어야 합니다. 그리고 우리가 지금 있는 곳은 물론 스펙트럼의 어딘가입니다.

- - 우리는 이제 자동 완성보다 합리적으로 덜 편리하지만, 여전히 답을 기다리기 위해 한 달 동안 앉아 있을 필요는 없는 더 똑똑한 모델을 가지고 있습니다. 그래서 저는 우리의 과제 중 상당 부분이 언제 이 편의성을 왼쪽으로 당기는 데 투자할지, 언제 지능을 위로 올리는 데 투자할지 파악하는 것이라고 생각합니다. 그리고 그것은 방대한 디자인 공간입니다. 그것이 재미있는 이유입니다.

- - 저는 2020년 AI 채널 출시 때 소개된 앱을 만들었습니다. 물론입니다. 그리고 그때의 어려움은 GPT-3 앱이 매우 유능했지만, 무언가를 하게 하려면 600단어 정도의 프롬프트를 작성해야 했다는 것입니다. 그리고 토큰당 6센트의 지연 시간 때문에 '지금은 이 세상이 아닌 것 같다'고 생각했습니다. 네. 그리고 GPT-3.5와 GPT-4가 나오면서 갑자기 모든 기능이 보입니다.

- - 그리고 왜 그런지 말하기 어려웠지만, 갑자기 모든 것이 합쳐지는 것을 보게 됩니다. 그리고 당신은 작업 공간 내에서 모델이 맥락을 볼 수 있다는 아이디어를 언급했습니다. 그리고 저는 ChatGPT를 사용하여 제 작업 공간에 복사하여 붙여넣을 때, 쇼핑몰에 가서 카트를 사용하지 않고 모든 것을 계산대로 들고 가는 것을 거부하는 것을 떠올렸습니다. '이것은 끔찍하게 비효율적이다'라고 생각했습니다. 일단 물건을 바퀴 위에 올려놓으면 정말 잘 작동합니다. 그리고 우리는 이제 모든 종류의 잠금 해제(unlocks)를 보고 있다고 생각합니다.

- - 이제 제가 무언가를 작업하기 위해 앉을 때 겪는 문제는, CLI로 가야 할까요? VS Code 플러그인을 사용해야 할까요? 커서(Cursor)로 가야 할까요? 아니면 다른 도구를 사용해야 할까요? 그리고 여러분들은 이것을 어떻게 파악합니까?

- - 지금은 여전히 실험 단계에 있으며, 에이전트와 상호 작용하고 여러분이 이미 생산적인 곳으로 가져오기 위한 다양한 방법을 시도하고 있습니다. 그래서, 예를 들어, 코덱스는 이제 GitHub에 있습니다. 여러분은 코덱스를 언급할 수 있고, 그것은 여러분을 위해 작업을 수행할 것입니다. 코덱스를 추가하고, 이 버그를 수정하거나, 테스트를 이쪽으로 옮기라고 하면, 그것은 우리의 데이터 센터에 있는 자체 노트북에서 실행될 것입니다. 그리고 여러분은 그것에 대해 생각할 필요가 없습니다.

- - 그러나 폴더의 파일로 작업하는 경우, IDE에서 할 것인지 터미널에서 할 것인지 결정해야 합니다. 우리가 보는 것은, 파워 유저들은 터미널에서 훨씬 더 복잡한 워크플로우를 개발하고 있다는 것입니다. 그리고 실제로 파일이나 프로젝트에서 작업할 때는 IDE에서 하는 것을 선호합니다. 그것은 조금 더 세련된 인터페이스입니다. 실행 취소(undo)를 할 수 있습니다. 편집 내용을 볼 수 있습니다. 그냥 스크롤로 지나가는 것이 아닙니다.

- - 그리고 터미널은 또한 놀라운 바이브 코딩 도구입니다. 생성되는 코드에 대해 그렇게 많이 신경 쓰지 않는다면, 작은 앱을 생성할 수 있습니다. 그것은 코드에 집중하기보다는 상호 작용을 더 고양시키는 것에 가깝습니다. 그래서 그것은 결과에 더 집중합니다. 그리고 그것은 여러분이 무엇을 하고 싶은지에 따라 달라지지만, 지금은 여전히 실험 단계에 있습니다. 그리고 우리는 다양한 것을 시도하고 있으며, 앞으로도 계속 그럴 것이라고 생각합니다.

- - 네, 저도 그것에 정말 동의합니다. 그리고 저는 우리의 방향 중 많은 부분이 이러한 것들 전반에 걸친 더 많은 통합이 될 것이라고 생각합니다. 사람들은 여러 도구를 사용할 수 있습니다. 그렇죠? 여러분은 이미 터미널, 브라우저, GitHub 웹 인터페이스, 로컬 머신의 저장소(repo)를 가지고 있습니다.

- - 이 각각은 사람들이 어떤 도구를 언제 사용하는 것이 적절한지 배운 것입니다. 그리고 저는 우리가 이 실험 단계에 있기 때문에 이러한 것들이 매우 이질적이고 매우 다르게 느껴질 수 있다고 생각합니다. 그리고 관련 도구의 새로운 기술 세트와 특성을 배워야 하는 것처럼 느껴집니다.

- - 그리고 저는 우리가 반복하는 많은 부분이 '이것들이 어떻게 서로 맞물리는가'를 실제로 생각하는 것이 우리의 책임이라고 생각합니다. 그리고 코덱스 IDE 확장이 원격 코덱스 작업을 실행할 수 있는 것을 통해 그것을 보기 시작할 수 있습니다.

- - 그리고 저는 궁극적으로 우리의 비전은 자체 컴퓨터, 자체 클러스터에 접근할 수 있는 AI가 있어야 하지만, 또한 여러분의 어깨 너머로 볼 수 있어야 한다는 것입니다. 또한 로컬로 와서 여러분을 도울 수 있어야 합니다. 그리고 이것들은 별개의 것이 아니어야 합니다.

- - 맞습니다. 그리고 그것은 여러분을 돕고 협력하기 위해 존재하는 이 하나의 코딩 엔티티와 같습니다. 제가 그렉과 협력할 때, 때때로 당신이 Slack에 있거나, 때때로 제가 당신에게 직접 이야기한다고 불평하지 않습니다. 때때로 당신은 불평합니다. 때때로 우리는 GitHub 검토를 통해 상호 작용합니다. 이것은 여러분이 다른 인간 및 협력자와 상호 작용할 때 매우 자연스러워 보입니다.

- - 그리고 이것은 또한 우리가 코덱스를 실제로 무언가를 달성하려고 할 때 여러분에게 초고속 충전(supercharge)을 하기 위한 에이전트적인 엔티티로 생각하는 방식이기도 합니다.

- - 그럼 에이전트.md(agents.md)와 같은 것을 사용하는 몇 가지 방법에 대해 이야기해 봅시다. 그것을 설명해 주시겠습니까? 네, agents.md는 코덱스에게 줄 수 있는 일련의 명령으로, 코드와 함께 존재합니다. 그래서 코덱스는 코드를 가장 잘 탐색하고 작업을 완수하는 방법에 대해 조금 더 많은 맥락을 가집니다.

- - 우리가 유용하다고 생각하는 agents.md에 넣을 두 가지 주요 사항이 있습니다. 코덱스.md를 읽는 것이 전체 코드 기반을 탐색하는 것보다 에이전트에게 조금 더 효율적인 압축(compression) 같은 것에 도움을 줍니다.

- - 그리고 코드 기반 자체에서 명확하지 않은 선호도(preferences)입니다. 여기서 여러분은 '실제로 테스트는 여기에 있어야 한다'고 말하거나, '나는 일들이 이러한 특정 방식으로 수행되는 것을 좋아한다'고 말할 수 있습니다.

- - 그리고 이 두 가지, 즉 선호도와 에이전트에게 코드 기반을 효과적으로 탐색하는 방법을 설명하는 것은 agents.md에 있는 데 매우 유용한 것들입니다. 네.

- - 그리고 저는 여기에 근본적인 무언가가 있다고 생각합니다. 맥락이 없는 에이전트에게 여러분이 원하는 것, 여러분의 선호도를 어떻게 전달할 수 있을까요? 그리고 인간이 필요로 하는 종류의 준비 시간(spin up)을 조금이라도 절약하려고 노력하는 것입니다.

- - 우리는 인간을 위해 이것을 합니다. 우리는 readme.md를 작성합니다. 그리고 이것은 에이전트가 찾아봐야 할 파일 이름에 대한 규칙일 뿐입니다. 하지만 또한 약간 시점적인 것도 있습니다. 에이전트들은 지금 당장 좋은 기억력을 가지고 있지 않습니다. 여러분이 에이전트를 10번째 실행하고 있다면, 그것이 여러분을 위해 어려운 문제를 해결했던 아홉 번으로부터 실제로 이익을 얻었습니까?

- - 그래서 저는 우리가 기억력을 어떻게 가질지, 에이전트가 실제로 여러분의 코드 기반을 탐색하고 그것을 깊이 이해한 다음 그 지식을 활용할 수 있도록 하는 방법에 대해 생각하기 위해 실제 연구를 해야 한다고 생각합니다. 그래서 이것이 예시 중 하나이며, 더 많은 연구 발전의 결실을 볼 수 있는 많은 예시가 있습니다.

- - 지금은 매우 경쟁적인 환경입니다. OpenAI가 많은 사람들에게 갑자기 나타났던 시점이 있었습니다. 그리고 갑자기 GPT-3가 있었고, 그 다음에는 GPT-4가 있었습니다. 그리고 Anthropics도 훌륭한 모델을 구축하고 있다고 생각합니다. 그리고 Google의 Gemini도 정말 좋아졌습니다. 여러분들은 이 환경을 어떻게 보십니까? 그곳에서 여러분의 위치는 어떻다고 보십니까?

- - 저는 많은 발전이 이루어질 수 있다고 생각합니다. 저는 경쟁보다는 잠재력에 조금 덜 집중합니다. 왜냐하면 우리는 AGI가 가능할 것이라고, 사람들이 생각하는 것보다 더 빨리 가능할 수도 있다고 생각하며 2015년에 OpenAI를 시작했기 때문입니다. 그리고 우리는 그것이 전개되는 방식에 긍정적인 힘이 되기를 원합니다.

- - 그리고 그것이 무엇을 의미하는지 실제로 생각하고, 그것을 실용적인 실행에 연결하려고 노력하는 것이 많은 과제였습니다. 그래서 우리가 실제로 유용한, 실제로 사람들을 도울 수 있는 유능한 모델을 구축하는 방법을 알아내기 시작하면서, 그것을 사람들에게 실제로 가져오는 것이 이 정말 중요한 일입니다.

- - 그리고 여러분은 우리가 그 과정에서 내린 선택들을 볼 수 있습니다. 예를 들어, ChatGPT를 출시하고 ChatGPT 무료 계층을 널리 제공하는 것입니다. 그것은 우리가 우리의 사명 때문에, AI가 모든 사람에게 이용 가능하고 접근 가능하며 혜택을 주기를 정말로 생각하기 때문에 하는 일입니다.

- - 그래서 저의 관점으로는 가장 중요한 것은 그 기하급수적인 발전(exponential progress)을 계속하고 그것을 긍정적이고 유용한 방식으로 사람들에게 가져오는 방법을 생각하는 것입니다.

- - 그래서 저는 우리가 지금 있는 곳을 이 모델들, 즉 GPT-4 급의 사전 훈련된 모델들이 있다고 봅니다. 그것을 훨씬 더 안정적이고 스마트하게 만들기 위한 강화 학습이 그 위에 있습니다. 마치 여러분이 인터넷을 읽고, 많은 인간의 생각을 관찰했다고 가정해 봅시다. 그리고 여러분이 처음으로 코드를 작성하려고 한다면, 아마도 힘든 시간을 보낼 것입니다.

- - 그러나 여러분이 실제로 어려운 코드 문제를 해결하려고 시도할 수 있는 능력이 있고, 파이썬 인터프리터가 있고, 인간이 사용하는 종류의 도구에 접근할 수 있다면, 여러분은 훨씬 더 강력하고 세련될 수 있을 것입니다. 그래서 우리는 이제 이러한 조각들이 함께 작동하도록 만들었지만, 우리는 그것들을 다음 단계로 계속 밀어붙여야 합니다.

- - 대규모 코드 기반을 리팩토링할 수 있는 것과 같은 것들은 아직 아무도 해결하지 못했다는 것이 매우 분명합니다. 우리가 할 수 없는 근본적인 이유는 없습니다.

- - 그리고 저는 여러분이 그것을 얻는 순간, 코드 리팩토링이 기업을 위한 킬러 사용 사례 중 하나라고 생각합니다. 코드 마이그레이션 비용을 2배로 줄일 수 있다면, 마이그레이션이 10배 더 많이 일어날 것이라고 생각합니다.

- - COBOL에 갇힌 시스템의 수를 생각해 보세요. 그리고 COBOL 프로그래머는 양성되지 않고 있습니다. 그것은 단지 세상에 이 종속성을 갖는 책임(liability)을 구축하는 것과 같습니다. 이 문제를 실제로 해결할 수 있는 시스템을 구축하는 것이 유일한 방법입니다. 그래서 저는 그것이 거대한 미개척 공간이라고 생각합니다. 기하급수적인 발전은 계속되며 우리는 그 흐름에 머물러야 합니다.

- - 오늘 제가 가장 좋아하는 것은 OpenAI의 트윗이었습니다. CLI를 사용하여 완성(completions) API에서 응답(responses) API로 전환하는 방법을 보여주는 것이었습니다. 그것은 훌륭한 사용입니다. 저는 더 많은 것을 볼 것으로 기대합니다. 안정적으로 리팩토링과 같은 작업을 수행하기 위해 코덱스에게 특별한 지침이 주어지는 곳 말입니다. 그리고 여러분은 그것을 설정하고 그것이 여러분을 위해 그것을 수행하도록 합니다. 그것은 멋진 일입니다.

- - 마이그레이션은 최악의 일 중 일부입니다. 아무도 마이그레이션을 하고 싶어하지 않습니다. 아무도 한 라이브러리에서 다른 라이브러리로 변경하고 모든 것이 여전히 작동하는지 확인하고 싶어하지 않습니다. 우리가 그 대부분을 자동화할 수 있다면, 그것은 매우 아름다운 공헌이 될 것입니다.

- - 저는 다른 영역도 많다고 생각합니다. 저는 보안 패치와 같은 것이 곧 매우 중요해질 것이라고 생각하며, 그것은 우리가 매우 신중하게 생각하고 있는 것입니다. 저는 AI가 실제로 새로운 도구를 생산할 수 있다는 점을 생각합니다. 여러분은 유닉스 표준 도구 세트가 얼마나 중요했는지 생각합니다. 그리고 AI는 실제로 여러분에게 유용한, 자신에게 유용한 자체 도구를 구축할 수 있습니다.

- - 여러분은 효율성의 이 플라이휠(flywheel)을 계속 개선하기 위해 복잡성 또는 유용성의 사다리를 실제로 쌓아 올릴 수 있습니다. 단순히 코드를 작성하는 것뿐만 아니라 자신의 코드를 실행하고, 서비스를 관리하거나, SRE 작업을 수행할 수 있는 AI 말입니다. 저는 이 모든 것이 지평선 위에 있다고 생각합니다. 그것은 시작되고 있지만, 우리가 보고 싶은 방식으로 실제로 일어나고 있지는 않습니다.

- - 우리가 OpenAI 내부에서 해결하고 제품으로 출시하기로 결정한 큰 것 중 하나는 코드 검토였습니다. 우리는 검토해야 할 코드 양이 증가함에 따라 우리에게 큰 병목 현상이 팀에서 사람들이 해야 하는 검토량이라는 것을 알아차리기 시작했습니다. 그래서 우리는 PR을 검토하고, 여러분이 구현하려는 계약(contract)과 의도에 대해 깊이 생각하며, 코드를 보고 그 의도가 코드와 일치하는지 확인하는 매우 높은 신호의 코덱스 모드에 정말 집중하기로 결정했습니다.

- - 그리고 그것은 깊은 레이어로 들어가서, 모든 종속성을 보고, 계약에 대해 생각하고, 그리고 우리의 최고의 직원들, 최고의 검토자들이 몇 시간을 들여 그 PR에 대해 깊이 생각하지 않으면 찾을 수 없었을 것들을 실제로 제기할 수 있습니다. 그리고 우리는 이것을 OpenAI 내부에서 먼저 출시했습니다. 그것은 꽤 성공적이었고, 사람들은 그것이 고장 났을 때 실제로 화를 냈습니다. 왜냐하면 그들이 그 안전망을 잃고 있다고 느꼈기 때문입니다.

- - 그리고 그것은 팀들을, 코덱스 팀을 포함하여 엄청나게 가속화했습니다. 우리가 IDE 확장을 출시하기 전날 밤, 제 팀의 최고 엔지니어 중 한 명이 25개의 PR을 처리하고 있었습니다. 그리고 우리는 자동으로 꽤 많은 버그를 찾고 있었습니다. 코덱스가 꽤 많은 버그를 찾고 있었습니다. 그리고 다음날 거의 버그가 없는 IDE 확장을 출시할 수 있었습니다. 그래서 거기에서의 속도는 믿을 수 없을 정도입니다.

- - 그리고 코드 검토 도구의 경우 특히, 사람들이 이것을 활성화하는 것에 대해 매우 불안해했다는 것이 매우 흥미롭습니다. 왜냐하면 우리가 시도했던 모든 자동 코드 검토 실험에 대한 우리의 이전 경험은 그것이 단지 노이즈였기 때문입니다. 그냥 봇으로부터 이메일을 받고, '아, 또 그런 것 중 하나군'이라고 생각하고 무시합니다.

- - 그리고 저는 우리가 지금 있는 곳과는 정반대의 발견을 했다고 생각합니다. 그리고 그것은 능력이 임계값 아래에 있을 때, 그것이 완전히 순 마이너스처럼 느껴진다는 것을 정말 보여줍니다. '나는 그것에 대해 듣고 싶지 않아. 나는 그것을 보고 싶지 않아.'

- - 일단 유용성의 어떤 임계값을 넘어서면, 갑자기 사람들은 그것을 원하고, 그것이 사라지면 매우 화를 냅니다. 그리고 또한 우리의 관찰은 지금 AI에서 무언가가 작동한다면, 1년 후에는 그것이 믿을 수 없을 정도로 안정적이고, 믿을 수 없을 정도로 임무 중요적(mission critical)이 될 것이라는 것입니다. 그리고 저는 우리가 코드 검토에서 가고 있는 곳이 바로 거기라고 생각합니다.

- - 코드 검토에서 흥미로운 점 중 일부는 인간을 참여시키고, 이것이 검토를 포함하여 협력자가 되도록 하는 것입니다. 그리고 우리가 많이 가르친 한 가지는, 그 발견들을 어떻게 제기하여 여러분이 실제로 이 발견을 읽고 싶어하고, 심지어 틀렸을 때에도 무언가를 배울 수 있도록 할 수 있을까요?

- - 여러분은 그것의 추론을 실제로 이해할 수 있습니다. 대부분의 경우, 실제로 90% 이상은 맞습니다. 그리고 코드를 작성한 사람이나 코드를 검토하는 것을 돕는 사람으로서 여러분은 종종 무언가를 배웁니다.

- - 네, 우리가 이전에 발전 속도에 대해 말했던 것으로 되돌아가서, 때때로 한 걸음 물러나서 이전 상황이 어땠는지 생각하는 것입니다. 저는 GPT-3와 GPT-4의 경우 더블링 다운(doubling down) 문제에 정말 집중했던 것을 기억합니다. AI가 잘못된 것을 말하고 여러분이 실수를 지적하면 그것이 어떻게 되었는지 기억하십니까? 오, 그것은 당신과 논쟁했습니다. 네. 그것은 자신이 옳다고 여러분을 설득하려고 노력했습니다.

- - 우리는 그것이 핵심 문제인 시대를 훨씬 지났습니다. 저는 그것이 인간에게서도 그러하듯이, 일부 모호한 엣지 케이스에서 발생한다고 확신합니다. 하지만 우리가 올바른 것에 완전히 집중하지 못할 때에도, 중요한 것을 강조하고 있다는 수준에 있다는 것을 보는 것은 정말 놀랍습니다. 그것은 꽤 합리적인 생각을 가지고 있습니다. 그리고 저는 항상 이러한 코드 검토에서 '허, 알았어, 좋은 지적이네. 그것에 대해 생각해야겠다'라고 생각하며 물러납니다.

- - 우리는 이제 GPT-5를 막 출시하려고 합니다. 그리고 이 팟캐스트를 녹음하는 시점에서 우리는 이제 GPT-5 코덱스를 가지고 있습니다. 우리는 그것에 대해 엄청나게 흥분하고 있습니다. 매우 흥분됩니다. 왜 제가 이것에 대해 흥분해야 할까요, 신사 숙녀 여러분? 이것을 저에게 팔아보세요.

- - GPT-5 코덱스는 코덱스를 위해 최적화한 GPT-5의 버전입니다. 그리고 우리는 하네스에 대해 이야기했습니다. 그래서 그것은 하네스를 위해 최적화되었습니다. 우리는 그것을 일련의 도구와 매우 밀접하게 결합하는 하나의 에이전트로 간주합니다.

- - 그리고 그것은 훨씬 더 신뢰할 수 있습니다. 이 모델이 보여주는 것 중 하나는 훨씬 더 오랫동안 지속될 수 있는 능력이며, 이러한 복잡한 리팩토링 작업에 필요한 끈기(grit)를 실제로 가질 수 있다는 것입니다.

- - 그러나 동시에, 간단한 작업의 경우, 훨씬 더 빠르게 여러분에게 다가오고 많은 생각 없이 응답할 수 있습니다. 그래서 그것은 훌륭한 협력자입니다. 여러분은 코드에 대해 질문하고, 변경해야 하거나 더 잘 이해해야 하는 이 코드 조각이 어디에 있는지 찾고, 계획을 세울 수 있습니다.

- - 그러나 동시에, 여러분이 그것을 무언가에 투입하면, 그것은 매우, 매우 오랜 기간 동안 작동할 것입니다. 우리는 내부적으로 매우 복잡한 리팩토링을 위해 최대 7시간 동안 작동하는 것을 보았습니다. 우리는 이전에 다른 모델들이 그렇게 하는 것을 보지 못했습니다. 그리고 우리는 또한 코드 품질에 엄청나게 노력했습니다. 그리고 그것은 사람들이 코덱스 내에서 GPT-5를 사용하는 용도에 정말 최적화되어 있습니다.

- - 그래서 더 오래 작동한다고 말씀하실 때, 그것이 단순히 맥락을 계속 다시 넣는 것에 대해 이야기하는 것이 아니라, 실제로 결정을 내리고, 무엇이 중요한지 결정하고, 앞으로 나아가고 있다는 것입니까? 네. 맞습니다. 정말 까다로운 리팩토링을 상상해 보세요. 우리는 모두 코드가 유지 관리할 수 없다고 결정한 때를 다루어야 했습니다. 앞으로 나아가기 위해 몇 가지 변경을 해야 합니다. 그래서 여러분은 계획을 세우고 모델을 투입합니다.

- - 여러분은 코덱스, GPT-5 코덱스를 투입합니다. 그리고 그것은 모든 문제를 해결하고, 테스트를 실행하고, 테스트를 통과시키고, 리팩토링을 완전히 완료할 것입니다. 이것이 우리가 7시간 동안 하는 것을 본 것 중 하나입니다.

- - 네, 제가 정말 놀랍다고 생각하는 것은 이러한 모델들의 핵심 지능이 분명히 너무나 놀랍다는 것입니다. 심지어 3개월 또는 6개월 전에도 우리 모델들이 특정 기능을 찾기 위해 내부 코드 기반을 탐색하는 데 저보다 더 능숙했다고 생각합니다. 그리고 그것은 정말 정교한 것을 요구합니다.

- - 당신은 자신을 해고해야 할까요? 당신은 "그렉, 미안합니다..."라고 말할 것 같습니까? 왜냐하면 그것이 바로 그것이기 때문입니다. 저는 더 많은 것을 할 수 있습니다. 제가 시간을 보내고 싶은 것, 사람들이 제가 그것으로 알려지기를 원하는 것이 코드 기반에서 기능을 찾는 것일까요? 절대 아닙니다. 그것이 엔지니어로서 제가 시간을 보내고 싶은 것, 저의 가치를 정의하는 방식이 아닙니다.

- - 그리고 이제 그것이 저에게는 핵심이라고 생각합니다. 이 놀라운 지능이 있고, 그것이 첫째로 모든 종류의 평범하고 지루한 부분을 빨아들일 수 있다는 것입니다. 그리고 물론 재미있는 부분도 있습니다. 저는 사물의 아키텍처에 대해 정말 생각하는 것이 훌륭한 파트너라고 생각합니다. 하지만 저는 제가 시간을 어떻게 보낼지 선택할 수 있습니다.

- - 그리고 저는 얼마나 많은 에이전트를 어떤 작업에 실행할지, 일들을 어떻게 나눌지 생각할 수 있습니다. 그래서 저는 이것을 프로그래머를 위한 기회 표면(opportunity surface)을 증가시키는 것으로 봅니다. 그리고 저는 철저한 Emacs 사용자입니다. 저는 VS Code, Cursor, Windsurf와 같은 것들을 사용하기 시작했습니다. 부분적으로는 단순히 시도해 보기 위해서였지만, 부분적으로는 다양한 도구의 다양성을 좋아하기 때문입니다. 하지만 제가 터미널에서 벗어나도록 하는 것은 정말 어렵습니다.

- - 와. 하지만 저는 이제 임계값을 넘어섰다는 것을 알았습니다. 저는 제가 어떤 리팩토링을 하고 있을 때, '왜 내가 이 것을 타이핑하고 있지?'라고 생각하며 놓치고 있다는 것을 정말 발견합니다. 특정 구문에 대한 정확한 구문을 기억하려고 노력하거나, 이러한 매우 기계적인 일들을 하려고 노력하는 것과 같습니다. 저는 그냥 인턴이 그 일을 하도록 하고 싶다고 생각합니다. 하지만 이제 제 터미널에 그것이 있습니다. 그리고 저는 우리가 이 핵심 지능을 가지고 있고, 언제 어떻게 사용할지 선택할 수 있는 지점에 있다는 것이 정말 놀랍다고 생각합니다.

- - 확장 기능에 'Whisper'를 추가해 주세요. 왜냐하면 이제 저는 모델에게 말하고 무언가를 하라고 말하는 것을 좋아하기 때문입니다. 네. 여러분은 모델과 영상 통화를 할 수 있어야 합니다. 저는 우리가 진정한 협력자, 진정한 동료를 향해 가고 있다고 생각합니다.

- - 음, 네, 미래에 대해 이야기해 봅시다. 이것이 어디로 향하고 있다고 보십니까? 에이전트적인 미래에 대해 흥미로운 점은 무엇이라고 보십니까? 우리는 이 시스템들을 어떻게 사용하게 될까요?

- - 우리는 이것이 향하는 방식이 클라우드의 어딘가에 있는 대규모 에이전트 집단이며, 인간으로서, 사람들로서, 팀으로서, 조직으로서 우리가 감독하고 조종하여 큰 경제적 가치를 창출할 것이라는 강한 확신을 가지고 있습니다. 그래서 지금부터 몇 년 후에는 이것이 이런 모습일 것입니다. 수백만 개의 에이전트가 우리와 회사의 데이터 센터에서 유용한 작업을 수행할 것입니다. 이제 문제는 우리가 점진적으로 어떻게 거기에 도달할까요?

- - 그리고 올바른 형태 인자와 올바른 상호 작용 패턴을 어떻게 실험할까요? 해결해야 할 믿을 수 없을 정도로 중요한 것 중 하나는 이 모든 것의 안전, 보안, 정렬(alignment)입니다. 그래서 에이전트가 유용한 작업을 수행할 수 있지만 안전한 방식으로 수행할 수 있도록 합니다. 그리고 여러분은 운영자로서, 인간으로서 항상 통제권을 유지해야 합니다. 그리고 이것이 코덱스 CLI의 경우, 기본적으로 에이전트가 샌드박스에서 작동하며 컴퓨터에서 파일을 무작위로 편집할 수 없는 이유입니다.

- - 그리고 우리는 기본적으로 환경을 안전하게 만드는 데 많은 투자를 계속할 것이며, 인간이 언제 조종해야 하는지, 인간이 특정 작업을 언제 승인해야 하는지 이해하는 데 투자할 것이며, 여러분의 에이전트가 여러분이 허용하는 자체 권한 세트를 갖도록 더 많은 권한을 부여하고, 여러분이 예외적으로 더 위험한 일을 하도록 허용할 때 권한을 에스컬레이션할 수도 있습니다. 그래서 이 전체 시스템을 파악하고, 그것을 다중 에이전트로 만들고, 개인, 팀, 조직이 조종할 수 있도록 하고, 조직의 전체 의도와 그것을 정렬시키는 것이 바로 이것이 향하는 곳입니다.

- - 그것은 약간 모호하지만, 또한 매우 흥미롭다고 생각합니다. 네, 저는 그것이 정확하다고 생각합니다. 저는 확대된 수준에서 해결해야 할 기술적인 문제들이 많다고 생각합니다. 티보가 말하는 것처럼 확장 가능한 감독(scalable oversight) 말입니다. 인간으로서 많은 코드를 작성하는 에이전트를 어떻게 관리합니까? 여러분은 아마도 모든 코드 줄을 읽고 싶지 않을 것입니다. 아마도 지금 당장 대부분의 사람들은 이 시스템에서 나오는 모든 코드를 읽지 않을 것입니다.

- - 하지만 어떻게 해야 할까요? 하지만 신뢰를 어떻게 유지할까요? AI가 실제로 정확한 것을 생성하도록 어떻게 보장할까요? 그리고 저는 기술적인 접근 방식이 있다고 생각합니다. 그리고 우리는 아마도 2017년부터 이러한 종류의 것들에 대해 생각하고 있었습니다. 인간 또는 더 약한 AI가 훨씬 더 강력한 AI를 감독하고 결국 스스로를 부트스트랩(bootstrapping)할 수 있는 전략을 처음으로 발표했습니다.

- - 그들이 매우 유능하고 중요한 작업을 수행할 때, 우리가 신뢰와 감독을 유지하고 운전석에 있을 수 있도록 하는 것입니다. 그래서 그것은 매우 중요한 문제이며, 점점 더 유능한 코딩 에이전트에 대해 생각함으로써 매우 실용적인 방식으로 예시됩니다.

- - 그러나 놓치기 쉬운 다른 차원도 있다고 생각합니다. 왜냐하면 AI 능력의 각 수준에서 사람들은 그들이 보는 것에 과적합(overfit)하고 '아, 이것이 AI다. 이것이 AI가 될 것이다'라고 생각하기 때문입니다. 하지만 우리가 아직 보지 못한 것은 AI가 정말 어렵고 새로운 문제(hard novel problems)를 해결하는 것입니다.

- - 지금은 여러분이 '좋아, 리팩토링을 해야 해'라고 생각합니다. 여러분은 적어도 그 일의 형태를 가지고 있습니다. 그것은 많은 작업을 여러분을 위해 해주고, 많은 시간을 절약해 줄 것입니다. 하지만 다른 수단으로는 근본적으로 해결할 수 없는 문제를 해결하는 것은 어떻습니까?

- - 그리고 저는 이것을 코딩 영역에서만 생각하는 것이 아니라, 의학에서 새로운 약물을 생산하는 것, 재료 과학에서 새로운 특성을 가진 새로운 재료를 생산하는 것을 생각합니다. 그리고 저는 이러한 종류의 응용 프로그램을 잠금 해제할 수 있는 많은 새로운 기능이 곧 출시될 것이라고 생각합니다.

- - 그래서 저에게 있어서 하나의 큰 이정표는 AI에 의해 생산된 인공물(artifact)이 그 자체로 극도로 가치 있고 흥미로운 첫 번째 순간입니다. 그것이 AI에 의해 생산되었기 때문이 아니라, 생산하는 데 더 저렴했기 때문이 아니라, 단순히 획기적인 발전(breakthrough)이기 때문입니다. 단순히 새로운 것이기 때문입니다.

- - 그리고 AI가 반드시 자율적으로 생성할 필요는 없지만, 인간과의 파트너십에서 AI가 중요한 종속성을 가지고 있는 것입니다. 그리고 저는 우리가 이러한 종류의 것들에 대한 생명의 징후를 보기 시작했다고 생각합니다.

- - 우리는 생명 과학에서 인간 실험자들이 O3(GPT-3 쯤을 지칭하는 것으로 보임)에게 실행할 실험 프로토콜에 대한 다섯 가지 아이디어를 요청하는 것을 보고 있습니다. 그들은 그 다섯 가지 중 네 가지는 작동하지 않습니다. 하나는 작동합니다.

- - 그리고 우리가 받고 있는 종류의 피드백은, 이것은 O3 시절이었는데, 그 결과가 3학년 또는 4학년 박사 과정 학생에게서 기대할 수 있는 수준이라는 것입니다. 이것은 미친 짓입니다. 네. 미친 짓입니다. 그리고 그것은 O3였습니다. 그렇죠?

- - GPT-5와 GPT-5 Pro에서는 완전히 다른 결과를 보고 있습니다. 거기서 우리는 연구 과학자들이 '좋아, 이것은 실제로 새로운 일을 하고 있다'고 말하는 것을 보고 있습니다. 그리고 때때로 그것은 다시 말하지만, 자체적으로 이러한 거대한 이론들을 해결하는 것이 아니라, 파트너십을 통해 인간이 도움 없이 갈 수 있는 곳을 훨씬 넘어서 확장할 수 있는 것입니다. 그리고 그것이 저에게는 우리가 계속 추진하고 올바르게 해야 하는 중요한 것 중 하나입니다.

- - 제가 미래에 대해 사람들에게 이야기할 때 겪는 어려움 중 하나는, 사람들이 미래를 일종의 현재로 상상하지만, 번쩍이는 옷과 로봇이 있는 것으로 생각한다는 것입니다. 그리고 그들은 '음, 로봇이 모든 코드를 할 때 무슨 일이 일어날까요?'라고 생각합니다. 그리고 당신은 당신이 하고 싶은 일과 하기 싫은 일에 대한 사실을 언급했습니다.

- - 2030년에 우리는 어디에 있을까요? 어떤 모습일까요? 5년 전은 GPT-3였습니다. 이제 5년 후입니다. 2030년입니다. 우리는 불과 6개월 전에는 이것들을 가지고 있지 않았습니다. 그래서 지금부터 5년 후에 이것이 정확히 어떤 모습일지 상상하기는 어렵습니다.

- - 5년 후 제가 이 팟캐스트를 들고 덤불에서 튀어나와서 '당신이 이렇게 말했다'고 할 것입니다. 음, 당신의 에이전트가 당신을 위해 그것을 할 것입니다. 네, 그럴 것입니다. 그래서 중요한 한 가지는, 사회를 뒷받침하는 중요한 인프라이자 코드인 것들을 우리가 계속 이해하고 이해할 수 있는 도구를 가져야 한다는 것입니다. 그리고 이것이 또한 우리가 코드 검토에 대해 생각하고 있었던 이유입니다. 코드 검토는 여러분이 그 코드를 이해하도록 돕고, 잠재적으로 AI가 작성한 다른 사람이 작성한 코드를 깊이 파고드는 것을 돕는 팀원이 되어야 합니다.

- - 그리고 저는 우리가 이미 문제가 있다고 주장하고 싶습니다. 보안이 확보되지 않은 많은 코드가 있습니다. 이것은 항상 일어납니다. 저는 약 12년 전쯤의 하트블리드(Heartbleed)를 기억합니다. 인터넷 전반에 걸쳐 사용되는 핵심 소프트웨어의 심각한 취약점이었습니다. 그리고 여러분은 그것이 단 하나의 사건이 아니라는 것을 깨닫습니다. 아무도 찾지 못한 많은 취약점이 있다는 것입니다.

- - NPM의 모든 패키지와 사람들이 익스플로잇(exploit)을 넣은 채 그냥 있는 모든 패키지들 말입니다. 그리고 그것이 항상 작동했던 방식은 공격자들이 더 정교해지고, 방어자들이 더 나아지는 숨바꼭질 게임(cat and mouse game)이 있었다는 것입니다. 그리고 저는 AI를 통해 '음, 그것이 어느 쪽에 가장 유리할까요?'라고 생각할 것입니다. 아마도 이 숨바꼭질을 가속화할 뿐일 것입니다.

- - 그러나 저는 실제로 AI를 통해 방어의 최종 단계(end game)인 형식 검증(formal verification)과 같은 근본적으로 새로운 능력을 잠금 해제할 수 있다는 희망이 있다고 생각합니다. 그리고 그것이 저에게는 매우 흥미롭습니다. 이 끝없는 쥐 경주를 어떻게 계속할 것인지가 아니라, 실제로 안정성을 높이고 이해 가능성을 높이는 것으로 어떻게 끝날 것인지에 대해 생각하는 것입니다.

- - 그리고 저는 우리가 현재 전통적인 소프트웨어 시스템에 대한 인간 이해의 경계에 있기 때문에, 우리 시스템을 이해할 수 있는 그러한 다른 기회들이 있다고 생각합니다.

- - 우리가 코덱스를 구축한 이유 중 하나는 세상의 코드 양을 늘리기 위해서가 아니라, 세상의 인프라와 코드를 개선하기 위해서입니다. 그리고 이것은 매우 중요한 지점입니다. 그것은 또한 버그를 찾는 것을 돕고, 리팩토링을 돕고, 동일한 것을 달성하거나 실제로 더 일반적인, 더 우아하고 성능이 좋은 구현을 찾는 것을 돕습니다.

- - 그러나 여러분이 이해하지 못하는 1억 줄의 코드로 끝나지는 않습니다. 제가 정말 흥분하는 한 가지는 코덱스가 팀, 개인을 돕고, 더 나은 코드를 작성하고, 더 나은 소프트웨어 엔지니어가 되도록 돕고, 실제로 우리를 위해 더 많은 일을 하는 더 간단한 시스템으로 끝나는 방식입니다.

- - 저는 2030년의 전망 중 일부는 우리가 물질적 풍요(material abundance)의 세계에 있을 것이라는 것입니다. 저는 AI가 여러분이 원하는 모든 것을 창조하는 것을 상상할 수 있는 것보다 훨씬 더 쉽게 만들 것이라고 생각합니다. 그리고 그것은 예측하기 어려운 방식으로 디지털 세계뿐만 아니라 물리적 세계에서도 사실일 것입니다.

- - 그러나 저는 그것이 절대적인 컴퓨팅 희소성(absolute compute scarcity)의 세계가 될 것이라고 생각합니다. 그리고 우리는 OpenAI 내에서 이것이 어떤 것인지 조금 보았습니다. 서로 컴퓨팅을 차지하기 위해 싸우는 다양한 연구 프로젝트의 방식이나 연구 프로그램의 성공이 컴퓨팅 할당에 의해 결정되는 방식은 과장하기 어렵습니다.

- - 그리고 저는 여러분이 상상하는 모든 것을 생산하고 창조할 수 있는 여러분의 능력이 부분적으로는 여러분의 상상력에 의해, 부분적으로는 그 뒤에 있는 컴퓨팅 능력에 의해 제한될 세계에 있을 것이라고 생각합니다.

- - 그래서 우리가 많이 생각하는 한 가지는 세상의 컴퓨팅 공급을 어떻게 늘릴 것인가 하는 것입니다. 우리는 지능뿐만 아니라 그 지능의 가용성도 늘리고 싶습니다. 그리고 근본적으로 그것은 단순히 소프트웨어 문제가 아니라 물리적 인프라 문제입니다.

- - GPT-5와 관련하여 놀라운 점 중 하나는 우리가 그것을 무료 플랜, 플러스 플랜, 프로 플랜의 일부로 제공할 수 있다는 것입니다. 여러분은 플러스 플랜으로 코덱스를 사용할 수 있습니다. 여러분은 다른 모든 사람이 얻는 것과 동일한 버전의 GPT-5를 얻습니다. 그리고 그것은 이 믿을 수 없는 지능입니다. 하지만 이 모델은 또한 그런 면에서 믿을 수 없을 정도로 비용 효율적입니다.

- - 저는 모델이 훨씬 더 유능하다고 생각했지만, 이전 모델과 동일한 가격대 또는 일부 방식에서는 더 저렴하게 나왔다는 것이 저에게 정말 눈에 띄는 것 중 하나였습니다. 그리고 그것은 '와, 그 패턴들은 훌륭하다'는 것과 같았습니다.

- - 우리가 지능을 개선하고 가격을 인하하는 정도는 놓치기 쉽고 당연하게 여겨지기 쉽습니다. 하지만 그것은 실제로 미친 짓입니다. 우리는 O3에서 80% 정도의 가격 인하를 했던 것 같습니다. GPT-3 수준의 지능에 대해 토큰당 6센트라는 여러분의 지점을 본다면 말입니다. 네.

- - 신문 중 하나에서 '이 추론 모델들이 더 비싸졌다'고 불평하는 기사가 나왔습니다. 그러나 그들은 지난 6~7개월 동안 추론 모델과 추론 모델을 비교하지 않았고, 그것들이 얼마나 더 효율적이 되었는지를 비교하지 않았습니다.

- - 네. 그리고 그것은 계속될 것입니다. 컴퓨팅 희소성 지점에서, 제가 매우 시사적이라고 생각하는 한 가지는, 지금 당장 사람들이 백만 개의 GPU, 수백만 개의 GPU로 구성된 큰 집단을 구축하는 것에 대해 이야기한다는 것입니다.

- - 그러나 우리가 그리 멀지 않은 미래에, 여러분이 에이전트를 여러분을 대신하여 지속적으로 실행하기를 원할 지점에 도달한다면, 모든 사람이 그들만을 위한 전용 GPU를 원할 것이라는 것은 합리적입니다. 그리고 이제 우리는 우리가 필요한 것보다 몇 배나 적은 약 100억 개의 GPU에 대해 이야기하고 있습니다.

- - 그래서 저는 우리의 일 중 일부는 그 컴퓨팅을 공급하는 방법, 그것이 세상에 존재하도록 만드는 방법을 알아내는 것이라고 생각합니다. 하지만 지금 존재하는 매우 제한적인 컴퓨팅을 최대한 활용하는 방법도 있습니다. 그리고 그것은 효율성 문제입니다. 또한 지능을 높이는 문제이기도 합니다. 하지만 네, 이것을 실현하는 것은 많은 작업과 많은 구축이 될 것이라는 것이 매우 분명합니다.

- - 에이전트와 GPU, 그리고 그들의 행동과의 관계에서 흥미로운 점 중 하나는 GPU가 여러분 가까이에 있는 것이 또한 매우 유익하다는 것입니다. 왜냐하면, 그것이 작동하고 몇 분 동안 200번의 도구 호출을 할 때, 그것은 항상 GPU와 여러분의 노트북 사이를 왔다 갔다 하며 그 도구 호출을 실행하고, 그 맥락을 다시 얻고, 그리고 계속해서 숙고하기 때문입니다.

- - 그래서 GPU를 사람들에게 더 가깝게 가져오는 것은 거기서도 큰 기여입니다. 그리고 그것은 전체 상호 작용과 전체 롤아웃의 지연 시간을 엄청나게 줄여주기 때문에 정말 유익합니다.

- - 신사 숙녀 여러분, 우리는 노동에 대한 미래에 대해 주기적으로 나오는 질문을 받습니다. 코딩을 배워야 할까요, 배우지 말아야 할까요? 저는 코딩을 배우기에 멋진 시기라고 생각합니다. 저는 네, 동의합니다. 확실히 코딩을 배우되, AI를 사용하는 것을 배우는 것이 저에게는 가장 중요한 것입니다.

- - 코덱스를 사용하여 새로운 프로그래밍 언어에 대해 배우는 것은 엄청나게 즐거운 일입니다. 제 팀의 많은 사람들이 Rust를 처음 접했고, 우리는 핵심 하네스를 Rust로 구축하기로 결정했습니다.

- - 그리고 그들이 코덱스를 사용하고, 질문하고, 알지 못하는 코드 기반을 탐색하는 것만으로 새로운 언어를 얼마나 빨리 습득할 수 있는지 보는 것은 정말 훌륭했습니다. 그리고 여전히 훌륭한 결과를 달성하고 있습니다. 물론, 우리는 또한 높은 기준을 유지하기 위해 계속 멘토링하는 매우 경험 많은 Rust 엔지니어도 있습니다. 하지만 코딩을 배우기에 정말 재미있는 시간입니다.

- - 저는 제가 프로그래밍을 배웠던 방식이 W3 Schools 튜토리얼, PHP, JavaScript, HTML, CSS를 통해서였다는 것을 기억합니다. 그리고 제가 첫 번째 애플리케이션 중 일부를 구축하고 있을 때, 저는 데이터를 직렬화하는 방법을 알아내려고 노력하고 있었습니다. 저는 그것에 대한 단어조차 몰랐습니다. 그리고 저는 구분 기호 역할을 하는 특수 문자 시퀀스를 가진 일종의 구조를 생각해 냈습니다.

- - 그리고 데이터에 실제로 그 문자 시퀀스가 있다면 어떻게 될까요? 그것에 대해 이야기하지 맙시다. 그래서 저는 매우 특별한 시퀀스를 가져야 했습니다. 그리고 이것은 여러분에게 이러한 종류의 문제를 알려줄 튜토리얼이 없을 종류의 것입니다.

- - 하지만 코덱스는 코드 검토에서 '이봐, JSON 직렬화가 있어, 그냥 이 라이브러리를 사용해'라고 말할까요? 전적으로 그럴 것입니다. 그래서 저는 그것이 코딩을 훨씬 더 쉽게 만들고, 이 모든 바퀴를 다시 발명할 필요가 없도록 가속화할 잠재력, 그리고 여러분이 물어봐야 할 필요조차 몰랐던 질문에 대해 그것이 여러분을 대신하여 질문하거나 답할 수 있다는 것이 저에게는 구축하기에 그 어느 때보다 더 좋은 시기라고 생각하는 이유입니다.

- - 저는 그것이 문제를 해결하는 방식을 보는 것만으로도 많은 것을 배웠습니다. 새로운 라이브러리를 찾고, 새로운 방법 등을 찾았습니다. 그것이 종종 제가 때때로 그것에게 미친 작업을 주는 것을 좋아하는 이유입니다. 예를 들어, 천 줄의 코드만으로 자신만의 언어 모델을 어떻게 만들고, 무엇을 하려고 시도할까요? 그리고 때때로 그것은 실패할 수도 있지만, 여러분은 그것이 시도한 방향을 볼 수 있고, '오, 저런 것이 있다는 것조차 몰랐네'라고 생각하게 됩니다.

- - 또한 AI로 코딩하는 데 가장 성공적인 사람들은 소프트웨어 엔지니어링의 기초를 정말 연구하고 올바른 프레임워크를 마련했다는 것입니다. 아키텍처는 코드 기반을 구성하는 방법에 대해 가르쳤고, 그 다음 AI의 도움을 받고 있지만, 여전히 그 일반적인 청사진을 따르고 있습니다. 그리고 그것은 여러분을 정말 가속화하고, 실제로 작성되는 코드를 이해하지 못한다면 갈 수 있었던 것보다 훨씬 더 멀리 갈 수 있도록 합니다.

- - 이것을 출시한 이후, GPT-5에서 이것을 사용할 수 있게 한 이후, 코덱스로 배포할 수 있게 된 이후, 사용률은 어떻게 보셨습니까? 네, 사용량이 폭발적으로 증가했습니다. 그래서 우리는 사용자 전반에 걸쳐 사용량이 10배 이상 증가하는 것을 보았고, 이미 사용하고 있던 사용자들도 훨씬 더 많이 사용하고 있습니다. 그래서 우리는 더 정교한 사용을 보고 있으며, 사람들은 또한 더 오랜 기간 동안 그것을 사용하고 있습니다. 우리는 이제 관대한 제한과 함께 PLUS 및 PRO 플랜에 포함했으며, 그것이 성공에 많은 기여를 했습니다.

- - 네, 저는 사람들이 GPT-5를 어떻게 사용해야 하는지 깨닫기 시작하면서 분위기(vibes)도 정말 바뀌기 시작했다고 생각합니다. 약간 다른 특징이 있다고 생각합니다. 우리는 올바른 하네스와 도구, 그리고 이러한 것들이 어떻게 함께 맞물리는지에 대한 생태계에 대한 우리만의 관점을 가지고 있다고 생각합니다.

- - 그리고 일단 사람들이 그것을 이해하면, 그들은 정말 빠르게 나아갑니다. 신사 숙녀 여러분, 여기에 참여하여 이것에 대해 이야기해 주셔서 대단히 감사합니다. 마지막으로 하실 말씀이 있으십니까? 초대해 주셔서 감사합니다. 네, 저희는 다음에 올 모든 것에 대해 정말 기대하고 있습니다. 저는 우리가 구축해야 할 것이 너무 많다고 생각합니다. 발전은 기하급수적으로 계속되고 있으며, 이러한 도구를 모든 사람이 사용 가능하고 유용하게 만들도록 가져오는 것이 우리의 사명의 핵심입니다.

- - 네, 초대해 주셔서 감사합니다. 저도 매우 기대됩니다. 이제 코덱스가 있고 계속 개선되고 있으므로, 우리는 또한 매일 더 나은 코덱스를 구축하도록 가속화되고 있습니다. 그리고 개인적으로, 저는 이제 대부분의 사람들보다 코덱스와 더 많은 시간을 이야기한다고 생각합니다. 그리고 그것이 제가 AGI를 느끼는 방식이며, 더 많은 사람들이 그것으로부터 혜택을 볼 수 있기를 바랍니다.

---

- 앤드류 메인과 그렉 브록만, 티보 소티오가 함께한 이번 에피소드에서는 아젠다 코딩, GPT5 코덱스, 그리고 2030년에 상황이 어떻게 전개될지에 대해 논의합니다. 그렉 브록만은 더 뛰어난 지능이 결국 장기적으로 성공할 것이라고 확신하며, 티보 소티오는 GPT5가 코덱스 내에서 사용되는 용도에 정말 최적화되어 있다고 언급합니다. 앤드류 메인은 코덱스의 새로운 버전을 사용해보고 매우 깊은 인상을 받았으며, 이 기술이 몇 년 만에 얼마나 발전했는지 놀라움을 표했습니다.

- 언어 모델을 코딩에 사용한다는 아이디어는 GPT3 시절에, 함수 이름의 파이썬 정의인 독스트링을 입력하면 모델이 코드를 완성하는 아주 첫 번째 생명의 징후를 보았던 것에서 시작되었습니다. 그렉 브록만은 이 모습을 보자마자 이것이 성공하고 큰일이 될 것이라는 것을 알았습니다. 한때는 언어 모델이 일관성 있는 코드 천 줄을 작성하는 것이 큰 목표였지만, 이제 그 목표는 이미 지나갔습니다. 개발 과정에서는 작동하지 않는 결함이나 구멍들만 보게 되기 쉽지만, 때로는 한 걸음 물러나 실제로 상황이 얼마나 발전했는지 깨닫는 것이 중요합니다. 티보 소티오는 사람들이 새로운 기술에 얼마나 빨리 적응하고, 몇 년 만에 이 기술이 일상적으로 사용되는 도구가 되었는지에 대해 매료되었다고 말합니다.

- OpenAI는 일반 지능(AGI)을 추구하기 때문에, 원래는 모든 기능을 한 번에 개선하는 데 초점을 맞추는 것이 본능이었으나, 코딩은 항상 예외였습니다. OpenAI는 코딩 데이터와 코드 지표에 집중하고, 모델이 코드에서 어떻게 작동하는지 이해하려는 매우 독특한 프로그램을 가지고 있습니다. GPT4는 모든 면에서 도약한 단일 모델이었지만, 2021년경에는 파이썬에 초점을 맞춘 코덱스 모델을 훈련하여 코딩 능력 수준을 정말 높이려고 노력했습니다.

- 코덱스 데모는 오늘날 '바이브 코딩'이라고 불리는 것의 첫 번째 시연이었을 수 있습니다. 표준 언어 모델 작업의 인터페이스나 하네스는 단순한 반면, 코딩의 경우 텍스트가 실제로 살아 움직이며 실행되고 도구에 연결되어야 합니다. 그렉 브록만은 하네스가 지능만큼이나 모델을 유용하게 만드는 데 거의 동등한 부분이라는 것을 깨달았습니다. 티보 소티오는 하네스에 대해 모델을 나머지 인프라와 통합하여 모델이 실제로 환경에서 작동할 수 있도록 하는 도구 세트이자 루프 방식이라고 간단히 설명합니다. 이를 에이전트 루프라고 부르며, 모델을 뇌, 하네스를 몸이라고 비유할 수 있습니다. 이 조각들을 통합하고 엔드투엔드로 훈련하면 모델이 사용자를 대신하여 행동하고 창조하는 마법 같은 행동을 보이며 진정한 협력자가 됩니다.

- GPT3 시절에는 주석 처리된 코드를 작성하고 해시태그로 함수 설명을 넣어야 했지만, 이제 모델들은 코딩에 자연스럽고 직관적으로 능숙해졌습니다. 코딩에 대한 특별한 집중은 외부 수요와 내부 수요 모두에서 비롯되었습니다. 2022년에 GitHub과 협력하여 GitHub Copilot을 만들었을 때, 코딩 워크플로우 중간에 AI가 있을 때의 가속화되는 느낌을 처음으로 경험했습니다. 이때 **지연 시간은 제품의 특징**이라는 것이 분명해졌습니다. 자동 완성의 제약은 1500밀리초이며, 아무리 훌륭해도 이보다 느리면 사용자가 기다리지 않습니다. 따라서 제품 측면에서의 요구 사항은 지연 시간 제약 조건 내에서 가장 똑똑한 모델을 얻는 것이었습니다.

- GPT4처럼 훨씬 똑똑하지만 지연 시간 예산을 충족하지 못하는 모델의 경우, 인터페이스와 하네스를 바꿔야 합니다. 그렉 브록만은 인터페이스와 모델 사용 방식을 모델의 특성에 맞게 공동 발전시켜야 한다는 점을 중요한 주제로 강조합니다. 엄청나게 똑똑하지만 느린 모델도 가치가 있으며, 더 큰 지능이 장기적으로 성공할 것이라는 가설을 항상 가지고 있었습니다.

- 앤드류 메인은 GitHub Copilot 작업 당시에는 완성(completion)에 익숙했기 때문에 하네스를 구축하고 기능을 추가하는 것의 가치를 완전히 이해하지 못했지만, 이제 툴링과 모든 것이 큰 차이를 만든다는 것을 깨달았습니다. 현재 코덱스는 CLI, VS Code 플러그인, 웹 배포 등 다양한 형태 인자(modality)로 제공됩니다.

- 티보 소티오는 개발자들이 복잡한 문제를 디버깅하기 위해 ChatGPT에 점점 더 많은 맥락(코드 조각, 스택 추적 등)을 붙여넣으려는 경향을 보았다고 설명합니다. 이 상호 작용이 복잡해지자, 사용자가 주도하는 대신 모델이 실제로 상호 작용을 주도하고 스스로 맥락을 찾으며 어려운 문제를 디버깅할 수 있도록 하는 것이 중요하다는 것을 깨달았습니다. 이는 하네스에 대해 더 많이 생각하고 모델에 행동할 수 있는 능력을 부여하는 것으로 이어졌습니다.

- OpenAI는 여러 형태 인자를 반복했습니다. 초기에는 원격에서 실행하고 노트북을 닫아도 에이전트가 계속 작업할 수 있는 비동기 에이전트 하네스 방식에 전념했습니다. 터미널에서 완전히 작동하는 '10X'라는 내부 프로토타입도 있었는데, 이는 10배의 생산성 향상을 제공했지만, 제품으로 출시하기에는 충분히 세련되지 않았다고 판단했습니다.

- 그러나 이제는 이 에이전트를 터미널이나 IDE로 다시 가져와 개발자가 이미 사용하는 도구에서 협력자가 되도록 하는 데 집중하고 있습니다. 브록만은 원격 데몬이 로컬 에이전트에 연결되는 버전 등 다양한 배포 방식의 매트릭스가 있었다고 설명합니다. 궁극적으로 모두에게 유용한 도구를 원하지만, 내부 엔지니어들에게 먼저 유용하게 만드는 것이 중요했기 때문에 어디에 집중할지 파악하는 것이 과제였습니다. 올해 초, OpenAI는 연말까지 **에이전트 소프트웨어 엔지니어**라는 회사 목표를 설정했으며, 이를 구체화하는 것이 큰 과제였습니다.

- 그렉 브록만은 장기적으로 AI가 자체 컴퓨터를 가지고 에이전트 집단에 위임하며 여러 작업을 병렬로 해결하는 미래의 형태를 알고 있다고 말합니다. 하지만 현재는 모델들이 그 수준만큼 똑똑하지 않으므로, 터미널과 편집기에서 사용자가 작업을 수행하는 방식과 유사하게 보이는 에이전트를 갖는 것이 중요합니다. 이는 미래와 현재를 혼합하는 접근 방식이며, 코드 검토에 AI를 도입하여 유용한 작업을 선제적으로 수행하도록 만드는 것을 포함합니다.

- 티보 소티오는 현재 상황의 두 가지 요인으로 인프라의 어려움을 꼽습니다. 사람들은 복잡한 설정을 가지고 있어 코드가 완벽하게 컨테이너화될 수 없으며, 따라서 코덱스는 사용자가 있는 곳에서 환경을 활용할 수 있어야 합니다. 이는 코덱스 사용 경험에 대한 매우 쉬운 진입점을 제공합니다. 또한, 올바른 인터페이스가 무엇인지 실험할 수 있게 해줍니다. 이 모든 것은 새롭고 빠르게 진화하고 있으며, 제로 설정으로 쉽게 사용할 수 있도록 하는 것이 더 많은 사람에게 혜택을 주고 피드백을 얻어 혁신을 지속하는 데 중요합니다.

- 그렉 브록만은 터미널에서 맥락을 자동으로 볼 수 있는 ChatGPT 통합 기능이 오류를 복사하여 붙여넣을 필요를 없애주어 혁신적이었다는 엔지니어의 일화를 언급하며, 스마트한 모델뿐만 아니라 통합이 얼마나 중요한지 강조합니다. 그는 AI의 바람직한 두 차원으로 **지능**과 **편의성** (지연 시간, 비용, 통합)을 들며, 현재는 자동 완성보다는 덜 편리하지만 한 달을 기다려야 하는 것보다는 훨씬 편리한 더 똑똑한 모델을 가지고 있다고 설명합니다. 도전 과제는 편의성을 높이는 투자와 지능을 높이는 투자를 언제 할지 파악하는 것입니다.

- 앤드류 메인은 GPT3 앱을 위해 600단어 프롬프트를 작성하고 토큰당 6센트의 지연 시간을 감수해야 했던 경험을 회상하며, GPT3.5와 GPT4가 나오면서 모든 기능이 갑자기 합쳐지는 것을 보게 되었다고 말합니다. 그는 모델이 작업 공간 내에서 맥락을 볼 수 있다는 아이디어를 마트에서 카트를 거부하고 모든 것을 들고 계산대로 가는 비효율적인 행동에 비유합니다.

- 현재 코덱스 사용은 여전히 실험 단계에 있으며, 개발자가 이미 생산적인 곳으로 에이전트를 가져오기 위해 다양한 방법을 시도하고 있습니다. 예를 들어, 코덱스는 이제 GitHub에 통합되어 PR을 수정하거나 테스트를 옮기는 작업을 원격으로 수행할 수 있습니다. 로컬 파일 작업 시에는 파워 유저들은 터미널에서 복잡한 워크플로우를 개발하지만, 파일/프로젝트 작업에는 실행 취소나 편집 내용 확인이 가능한 IDE를 선호합니다. 터미널은 코드 자체보다는 상호 작용을 고양시키고 결과에 집중하는 '바이브 코딩' 도구로도 훌륭합니다.

- 그렉 브록만은 앞으로 더 많은 통합이 이루어질 것이라고 예상하며, 궁극적인 비전은 AI가 자체 컴퓨터나 클러스터에 접근할 수 있으면서도 로컬로 와서 사용자를 도울 수 있어야 하며, 이 두 가지가 별개의 것이 아니어야 한다는 것입니다. 티보 소티오는 코덱스를 마치 하나의 코딩 엔티티, 즉 협력자와 같이 생각하며, 인간 협력자와 상호 작용하듯 자연스러워야 한다고 강조합니다.

- agents.md는 코덱스에게 줄 수 있는 일련의 명령으로, 코드와 함께 존재합니다. 이는 코덱스가 코드를 가장 잘 탐색하고 작업을 완수하는 방법에 대한 더 많은 맥락을 제공합니다. agents.md는 전체 코드베이스를 탐색하는 것보다 에이전트에게 더 효율적인 맥락 압축을 돕고, 코드베이스 자체에서 명확하지 않은 선호도(예: 테스트 위치, 특정 코딩 방식)를 명시하는 데 유용합니다. 그렉 브록만은 agents.md가 맥락이 없는 에이전트에게 원하는 것을 전달하고 인간이 필요로 하는 준비 시간을 절약하려는 근본적인 시도라고 보며, 에이전트의 메모리 기능 향상에 대한 연구 필요성을 강조합니다.

- 현재 AI 환경은 경쟁이 치열하지만, 그렉 브록만은 경쟁보다는 잠재력에 집중합니다. OpenAI는 2015년부터 AGI가 가능할 것이라고 믿고 시작했으며, AI가 모두에게 유용하고 접근 가능하며 혜택을 주어야 한다는 사명 때문에 ChatGPT 무료 계층을 널리 제공하는 등의 선택을 했습니다. 가장 중요한 것은 기하급수적인 발전을 계속하고 이를 긍정적이고 유용한 방식으로 사람들에게 가져오는 것입니다.

- 현재 모델들은 GPT4 급의 사전 훈련된 모델 위에 강화 학습이 더해져 신뢰성과 스마트함이 향상되었습니다. 대규모 코드베이스를 리팩토링하는 것과 같은 영역은 아직 해결되지 않았지만, 이는 기업을 위한 **킬러 사용 사례** 중 하나가 될 것입니다. 코드 마이그레이션 비용을 낮추면 COBOL처럼 갇혀 있는 시스템 문제를 해결하는 유일한 방법이 될 수 있으며, 이는 거대한 미개척 공간입니다.

- 앤드류 메인은 CLI를 사용하여 완성(completions) API에서 응답(responses) API로 전환하는 방법을 보여주는 OpenAI의 트윗을 극찬하며, 마이그레이션과 같은 최악의 작업을 자동화하는 것은 아름다운 공헌이 될 것이라고 말합니다. 그렉 브록만은 보안 패치와 같이 곧 매우 중요해질 다른 영역과, AI가 실제로 새로운 도구를 생산하여 효율성의 플라이휠을 개선할 수 있는 잠재력을 언급합니다.

- OpenAI가 내부적으로 성공적으로 해결하고 제품으로 출시한 큰 문제 중 하나는 **코드 검토**였습니다. 코드 검토량이 병목 현상이 되자, 높은 신호의 코덱스 모드에 집중하여 PR을 검토하고 계약 및 의도와 코드 일치를 확인했습니다. 이 도구는 가장 숙련된 검토자도 몇 시간을 들여야 찾을 수 있었던 것들을 발견할 수 있었습니다. 내부 출시 후 코덱스 팀을 포함한 팀들의 속도를 엄청나게 가속화했으며, 사용자들은 안전망이 사라지는 느낌을 받아 고장 났을 때 실제로 화를 냈습니다.

- 그렉 브록만은 이전의 모든 자동 코드 검토 실험이 "노이즈"로 간주되었던 것과는 달리, 코덱스의 발견은 완전히 반대였다고 설명하며, 능력이 특정 임계값 이하일 때는 순 마이너스처럼 느껴지지만, 유용성의 임계값을 넘어서면 사람들은 그것을 원하고 사라지면 화를 낸다고 말합니다. 현재 AI에서 작동하는 것은 1년 후에는 믿을 수 없을 정도로 안정적이고 임무 중요적이 될 것입니다. 코드 검토에서 흥미로운 점은 인간을 참여시키는 협력자가 된다는 점이며, 발견 사항이 사용자에게 실제로 흥미를 유발하고, 때로는 틀렸을 때조차도 그 추론을 이해하고 무언가를 배울 수 있도록 제시하는 방법을 연구했습니다.

- GPT3와 GPT4 시절에 AI가 잘못된 것을 지적하면 사용자와 논쟁하며 자신이 옳다고 설득하려 했던 '더블링 다운' 문제는 이제 핵심 문제가 아닙니다. 현재 AI는 완벽하지 않더라도 중요한 것을 강조하고 합리적인 생각을 제시하는 수준에 도달했습니다.

- **GPT5 코덱스**가 출시되었으며, 이는 코덱스를 위해 최적화된 GPT5 버전입니다. 하네스를 위해 최적화되었으며, 모델을 도구 세트와 매우 밀접하게 결합하는 하나의 에이전트로 간주됩니다. GPT5 코덱스는 훨씬 더 신뢰할 수 있으며, 복잡한 리팩토링 작업에 필요한 끈기를 가지고 훨씬 오랫동안 지속될 수 있는 능력을 보여줍니다. 내부적으로는 매우 복잡한 리팩토링을 위해 최대 7시간 동안 작동하는 것이 관찰되었는데, 이는 이전 모델에서는 볼 수 없었던 것입니다. 동시에 간단한 작업의 경우 훨씬 빠르게 응답할 수 있습니다. '더 오래 작동한다'는 것은 단순히 맥락을 계속 넣는 것이 아니라, 실제로 결정을 내리고, 무엇이 중요한지 결정하며, 앞으로 나아가고 있다는 것을 의미합니다.

- 그렉 브록만은 이 모델들의 핵심 지능이 놀랍다고 말하며, AI가 코드베이스에서 기능을 찾는 것과 같은 평범하고 지루한 부분을 대신할 수 있기 때문에 프로그래머에게는 기회의 표면이 증가한다고 봅니다. 그는 자신이 시간을 어떻게 보낼지 선택할 수 있고, AI는 훌륭한 파트너가 될 수 있다고 말합니다. 그렉 브록만은 Emacs 사용자임에도 불구하고 이제는 터미널에서 기계적인 리팩토링 작업을 할 때 AI의 도움을 받지 못하는 것을 그리워하는 지점을 넘어섰다고 인정합니다.

- 미래는 인간이 감독하고 조종하여 큰 경제적 가치를 창출하는 클라우드 어딘가에 있는 대규모 에이전트 집단이 될 것이라는 강한 확신이 있습니다. 중요한 과제는 안전, 보안, 정렬(alignment)을 해결하는 것입니다. 에이전트가 유용한 작업을 안전한 방식으로 수행할 수 있도록 하며, 인간은 운영자로서 항상 통제권을 유지해야 합니다. 코덱스 CLI의 경우 에이전트는 기본적으로 샌드박스에서 작동합니다. 앞으로는 환경을 안전하게 만들고, 인간이 언제 조종하거나 특정 작업을 승인해야 하는지 이해하며, 에이전트에게 자체 권한을 부여하고 더 위험한 일을 할 때 권한을 에스컬레이션할 수 있도록 하는 데 계속 투자할 것입니다.

- 기술적으로는 티보 소티오가 언급한 확장 가능한 감독(scalable oversight) 문제가 해결되어야 합니다. 즉, 인간이 AI가 작성한 많은 코드를 모두 읽지 않으면서도 신뢰와 감독을 유지하는 방법입니다. 이와 관련하여 OpenAI는 2017년부터 인간이나 약한 AI가 더 강력한 AI를 감독할 수 있는 전략을 연구해왔습니다.

- 브록만은 놓치기 쉬운 다른 차원으로, AI가 **정말 어렵고 새로운 문제**를 해결하는 것을 아직 보지 못했다고 지적합니다. 이는 코딩 영역뿐만 아니라 의학에서 새로운 약물을 생산하거나 재료 과학에서 새로운 재료를 생산하는 것 등을 포함합니다. AI가 생산한 인공물이 단순히 더 저렴해서가 아니라, 그 자체로 획기적인 발전이기 때문에 극도로 가치 있고 흥미로운 첫 순간이 중요한 이정표가 될 것입니다. O3 시절에도 연구원들은 3~4년 차 박사 과정 학생 수준의 실험 프로토콜 아이디어를 얻었으며, GPT5에서는 연구 과학자들이 "실제로 새로운 일"을 하고 있다고 말하는 결과를 보고 있습니다.

- 2030년 전망에 대해, 브록만은 AI가 원하는 모든 것을 창조하는 것을 훨씬 쉽게 만들어 **물질적 풍요**의 세계가 될 것이라고 예측합니다. 그러나 동시에 **절대적인 컴퓨팅 희소성**의 세계가 될 것이라고 생각합니다. OpenAI 내부에서도 연구 프로젝트들이 컴퓨팅을 차지하기 위해 경쟁하는 모습을 보았으며, 미래에는 모든 사람이 자신만을 위한 전용 GPU를 원할 것이므로, 현재 필요한 것보다 몇 배나 적은 약 100억 개의 GPU가 필요할 수 있습니다. 따라서 지능뿐만 아니라 그 지능의 가용성을 높이기 위해 컴퓨팅 공급을 늘리는 방법을 알아내는 것이 중요하며, 이는 물리적 인프라 문제입니다.

- GPT5는 놀랍게도 PLUS 및 PRO 플랜의 일부로 제공될 수 있을 정도로 비용 효율적이며, 이전 모델과 동일하거나 더 저렴한 가격대로 출시되었습니다. 지능을 개선하고 가격을 인하하는 정도는 놓치기 쉽지만, 실제로는 매우 놀라운 발전입니다. 티보 소티오는 에이전트가 행동할 때 잦은 도구 호출로 인해 GPU가 사용자 가까이에 있는 것이 전체 상호 작용의 지연 시간을 엄청나게 줄여주어 매우 유익하다고 덧붙입니다.

- 코딩 학습에 대한 질문에 대해, 두 사람 모두 코딩을 배우기에 멋진 시기이며, **AI를 사용하는 것을 배우는 것**이 가장 중요하다고 강조합니다. 코덱스를 사용하여 새로운 프로그래밍 언어를 배우는 것은 엄청나게 즐거우며, 팀원들이 코덱스의 도움으로 Rust와 같은 새로운 언어를 빠르게 습득하는 것을 보았습니다. 코덱스는 코드를 더 쉽게 만들고, 바퀴를 재발명할 필요가 없도록 가속화하며, 사용자가 물어봐야 할 필요조차 몰랐던 질문에 대해 대신 질문하거나 답할 수 있는 잠재력이 있습니다. AI로 코딩하는 데 가장 성공적인 사람들은 소프트웨어 엔지니어링의 기초를 연구하고 올바른 아키텍처 프레임워크를 마련한 사람들입니다.

- GPT5 코덱스 출시 이후 사용률은 폭발적으로 증가하여 사용자 전반에 걸쳐 10배 이상 성장했으며, 기존 사용자들도 훨씬 더 많이 사용하고 있습니다. 사람들은 GPT5를 사용하는 방법을 깨닫기 시작하면서 분위기가 바뀌고 있으며, OpenAI의 하네스와 도구, 생태계가 함께 맞물리는 방식이 사용자에게 명확해지자 속도가 매우 빨라지고 있습니다. OpenAI는 앞으로 올 모든 것에 대해 기대하고 있으며, 기하급수적인 발전을 계속하고 이 도구를 모두가 사용할 수 있도록 하는 것이 사명의 핵심이라고 강조하며 대화를 마무리합니다.


***
감사합니다.