카테고리 없음

OpenAI, AGI의 시작을 알리는 혁신적인 AI 에이전트 공개: 챗GPT 에이전트의 모든 것

클로vㅏ 컴퓨터 2025. 7. 18. 08:31



OpenAI가 최신 AI 에이전트인 **'챗GPT 에이전트'**를 공개하며 인공지능의 새로운 지평을 열었습니다. 이 에이전트는 사용자의 복잡한 요구사항을 스스로 이해하고 다양한 도구를 활용하여 실제 작업을 수행하는 능력으로, 많은 이들에게 **AGI(범용 인공지능)의 시작점**으로 느껴질 만한 놀라운 경험을 제공합니다.

**챗GPT 에이전트의 탄생 배경과 핵심 역량**

비디오의 초반 설명에 따르면, OpenAI의 에이전트 팀(Yash, Jing, Casey, Issa 등)은 이미 올해 초 딥 리서치와 오퍼레이터라는 에이전트를 출시하여 AI가 복잡한 작업을 수행할 수 있음을 보여주었습니다. 하지만 사람들은 이러한 개별적인 기능들을 넘어, **자신의 컴퓨터를 활용하여 실제적이고 복잡한 작업을 수행할 수 있는 '통합된 에이전트'**를 원한다는 점이 명확해졌습니다. 사용자는 생각을 행동으로 옮기고, 다양한 도구를 사용하며, 터미널을 조작하고, 웹을 탐색하며, 심지어 스프레드시트나 슬라이드 같은 결과물을 만들어내는 등의 작업을 **오랜 시간 동안 끊김 없이** 수행하기를 바랐습니다. 바로 이러한 요구를 충족시키기 위해 챗GPT 에이전트가 탄생했습니다. 이는 마치 **AI가 진정으로 '컴퓨터를 사용하는' 시대**가 도래했음을 알리는 신호탄과 같습니다.

챗GPT 에이전트 모드를 활성화하는 방법은 매우 간단합니다. 사용자는 챗GPT 인터페이스 내에서 **도구 메뉴(tools menu)를 클릭하여 '에이전트(agent)'를 선택**하거나, **작성 바에 직접 'agent'를 입력**하여 모드를 전환할 수 있습니다.

**에이전트의 강력한 도구 상자: 가상 컴퓨터와 다양한 도구들**

라이브 데모에서 설명된 바와 같이, 챗GPT 에이전트는 마치 사람처럼 **자신만의 가상 컴퓨터**에 접근하여 작업을 수행합니다. 이 가상 컴퓨터에는 여러 가지 도구가 설치되어 있으며, 에이전트는 주어진 과제를 해결하기 위해 어떤 도구를 사용할지 스스로 결정합니다. 특히, 챗GPT 화면에는 **에이전트의 '생각의 흐름(chain of thought)'**이 텍스트로 오버레이되어 표시되는데, 이를 통해 에이전트가 다음 행동을 결정하기 위해 어떤 사고 과정을 거치는지 투명하게 확인할 수 있습니다.

에이전트가 활용하는 주요 도구들은 다음과 같습니다:

*   **텍스트 브라우저:** 이는 **'딥 리서치(Deep Research)' 도구와 유사**하며, 웹 페이지를 매우 효율적이고 빠르게 읽고 검색할 수 있게 해줍니다. 긴 기사를 읽는 데 특히 뛰어난 성능을 보입니다.
*   **시각적 브라우저:** **'오퍼레이터(Operator)' 도구와 유사**하며, 웹 페이지의 사용자 인터페이스(UI)와 실제로 상호작용할 수 있습니다. 즉, 커서를 사용하여 클릭하거나, 드래그하고, UI 구성요소를 열고, 양식을 작성하고, 텍스트 영역에 글을 입력하는 등 **시각적으로 인터랙티브한 웹 페이지**에서 탁월한 능력을 발휘합니다.
*   **터미널:** 에이전트가 **코드를 실행하고, 슬라이드 덱이나 스프레드시트와 같은 파일을 생성 및 분석**할 수 있도록 합니다. 또한, 터미널을 통해 **공개 API는 물론 구글 드라이브, 구글 캘린더, 깃허브, 쉐어포인트와 같은 개인 데이터 소스에도 API 호출**을 할 수 있습니다. 물론, 개인 데이터 소스에 접근하기 위해서는 사용자의 명시적인 연결이 필요하다고 설명되었습니다.
*   **이미지 생성 API:** 작업 과정에서 슬라이드 덱 등 필요한 경우 **멋진 시각 자료를 생성**할 수 있습니다.

이러한 도구들은 상호 보완적으로 작동하여 에이전트가 다양한 유형의 작업을 유연하게 처리할 수 있도록 합니다.

**강화 학습을 통한 '스마트한 도구 선택' 학습**

에이전트가 어떤 도구를 사용할지 어떻게 결정하는지에 대해 팀원 중 한 명인 야쉬가 설명했습니다. 모델은 **강화 학습(reinforcement learning)**을 통해 이러한 기능들 사이를 이동하도록 훈련되었습니다. 챗GPT 에이전트는 **텍스트 브라우저, 시각적 브라우저, 터미널이라는 통합된 도구 상자에 접근할 수 있는 최초의 모델**입니다.

모델의 학습을 돕기 위해 개발팀은 **모든 도구를 사용해야만 해결할 수 있는 '어려운 과제'**들을 생성했습니다. 이를 통해 모델은 단순히 도구 사용법을 배우는 것을 넘어, **주어진 작업에 따라 '언제 어떤 도구를 사용해야 하는지'**를 학습할 수 있었습니다. 훈련 초기에는 간단한 문제 해결에도 모든 도구를 사용하려 할 수 있지만, 문제를 정확하고 효율적으로 해결할 때마다 보상을 제공함으로써, 모델은 시간이 지남에 따라 **'더 스마트한 도구 선택'**을 하게 됩니다. 예를 들어, 특정 요구사항을 가진 레스토랑을 찾아 예약하는 경우, 모델은 먼저 텍스트 브라우저를 사용하여 후보군을 찾고, 그 다음 시각적 브라우저로 전환하여 음식 사진을 보거나 예약 가능 여부를 확인한 후 예약을 완료할 수 있다고 설명되었습니다. 창의적인 작업의 경우에도, 먼저 온라인에서 자료를 검색하고, 터미널로 전환하여 코드를 편집하고 결과물을 컴파일한 다음, 시각적 브라우저에서 최종 결과물을 확인할 수 있습니다. 개발팀은 이를 통해 **딥 리서치와 오퍼레이터의 장점을 모두 통합**하고 새로운 기능을 추가했다고 강조했습니다.

**오퍼레이터와 딥 리서치의 통합: 최상의 시너지**

이 프로젝트의 배경에는 기존 '오퍼레이터'와 '딥 리서치' 도구의 상호 보완적인 특성을 깨달은 경험이 있습니다. 몇 달 전 출시된 **오퍼레이터**는 온라인 작업(예: 예약, 이메일 전송)에 특화되어 있었고, 그로부터 2주 후 출시된 **딥 리서치**는 심층적인 인터넷 연구와 고품질 연구 보고서 생성에 강점이 있었습니다.

출시 후, 개발팀은 이 두 접근 방식이 사실상 **매우 상호 보완적**이라는 것을 알게 되었습니다. 예를 들어, 오퍼레이터는 매우 긴 기사를 스크롤하며 읽는 데 어려움을 겪었지만, 이는 딥 리서치가 잘하는 부분이었습니다. 반대로 딥 리서치는 웹 페이지의 인터랙티브한 요소나 시각적으로 복잡한 페이지와 상호작용하는 데 오퍼레이터만큼 능숙하지 못했습니다.

고객 피드백 또한 이러한 통합의 필요성을 뒷받침했습니다. 딥 리서치에 대한 가장 많이 요청된 기능 중 하나는 **웹사이트에 로그인하여 인증된 소스에 접근하는 능력**이었는데, 이는 오퍼레이터가 수행할 수 있는 기능이었습니다. 또한, 사람들이 오퍼레이터에게 시도하는 프롬프트 중에는 "여행을 계획하고 예약해 줘"와 같이 딥 리서치 유형의 요청이 많았다고 합니다. 이러한 통찰력을 바탕으로 개발팀은 **두 세계의 최고를 통합**하는 데 주력했다고 언급했습니다.

**사용자와의 협업: 멀티턴 및 상호 작용성**

라이브 데모 중 언급된 주요 기능 중 하나는 에이전트의 **협업적인 특성**입니다. 작업이 길어질 수 있기 때문에 에이전트와 사용자 간의 **양방향 소통**이 매우 중요하다고 강조되었습니다.

*   **멀티턴 및 중단 가능성:** 에이전트가 복잡한 작업을 수행하는 데 15분, 20분, 심지어 30분까지 걸릴 수 있습니다. 이 과정에서 사용자는 에이전트에게 **새로운 지침을 주거나, 기존 작업을 중단하고 다른 요청을 추가**할 수 있습니다. 예를 들어, 결혼식 준비를 하던 중 "검은색 남자 드레스 신발도 찾아달라"는 요청이 추가되자, 에이전트는 이를 즉시 인지하고 작업 흐름에 통합하는 모습을 보여주었습니다. 이는 마치 사람과 대화하듯이 유연하게 **상호작용할 수 있는 능력**을 의미합니다.
*   **명확화 및 확인 요청:** 에이전트는 딥 리서치처럼 매번 질문하는 방식은 아니지만, **작업 중간에 명확한 질문을 하거나 확인을 요청**하도록 훈련되었습니다. 예를 들어, 중요한 단계의 마지막에는 사용자에게 확인을 요청할 수 있는데, 이는 이메일을 보내기 전에 초안을 검토해달라고 요청하는 것과 같습니다. 이는 에이전트가 실수할 수 있다는 점을 인지하고, 중요한 결정을 내리기 전에 사용자로부터 동의를 얻도록 학습되었음을 보여줍니다.
*   **사용자 개입 및 '테이크오버' 모드:** 만약 에이전트가 실수를 하거나, 사용자가 직접 개입하고 싶을 경우, **수정 지시를 내리거나 심지어 직접 에이전트의 브라우저 환경을 '테이크오버(takeover)'하여 직접 수정**할 수도 있습니다. 이는 사용자가 에이전트와 **협력적인 방식으로 작업**할 수 있도록 합니다.

**다양한 데모를 통해 본 챗GPT 에이전트의 활용 사례**

라이브 스트림에서는 챗GPT 에이전트의 놀라운 기능을 보여주는 여러 데모가 시연되었습니다.

*   **결혼식 준비:** 미니와 사라의 결혼식을 위해 **의상(드레스 코드, 장소, 날씨 고려), 호텔, 선물**을 찾아달라는 요청이 주어졌습니다. 에이전트는 텍스트 브라우저로 날씨를 확인하고 웹사이트를 탐색했으며, 시각적 브라우저로 전환하여 에드워드를 위한 정장을 시각적으로 확인하는 과정을 거쳤습니다. 최종적으로 **결혼식 정보, 의상 추천, 호텔 옵션(예약닷컴에서 확인), 선물 제안 등 포괄적인 보고서**를 제공했습니다. 심지어 확인했던 웹사이트 스크린샷까지 첨부되었습니다.
*   **팀 스티커 주문:** 팀 마스코트 '버니 두들' 노트북 스티커 500개를 주문해달라는 요청에 에이전트는 **이미지 생성 도구를 사용하여 애니메이션 아트**를 만들고, '스티커 뮬(Sticker Mule)' 웹사이트에서 **장바구니에 제품을 추가**하는 과정을 보여주었습니다. 최종 결제 단계에서는 사용자가 직접 신용카드 정보를 입력하도록 '테이크오버'를 제안했습니다. 이 작업은 약 7분 만에 완료되었습니다.
*   **MLB 경기장 여행 계획:** 라이브로 시연되지는 않았지만, 모든 30개 MLB 경기장을 방문하는 **최적의 여행 일정을 설계**하고, '헬로 키티 나이트'를 우선시하며, **세부적인 스프레드시트 형태의 최종 계획**을 제시하는 데모도 언급되었습니다. 에이전트는 코드를 사용하여 지도를 만들고, 다양한 도구를 활용하여 이 복잡한 작업을 25분 만에 완료했습니다. 완성된 스프레드시트는 챗GPT 내부에서 바로 확인할 수 있었습니다.
*   **모델 자체 평가 (메타 작업):** 가장 흥미로운 데모 중 하나는 에이전트에게 **자신의 진화 번호를 구글 드라이브 커넥터에서 가져와 슬라이드를 만들도록** 요청한 것이었습니다. 이는 에이전트가 **구글 드라이브 API에 연결하고, API 내에서 검색하며, 결과물을 읽고, 이미지를 생성하고, 코드를 작성하여 슬라이드를 컴파일**하는 과정을 보여주었습니다. 특히, 에이전트가 **스스로 결과물을 검토하고 개선하여 더 나은 최종 결과물**을 만들어내는 강화 학습의 특징을 시각적으로 보여주었습니다.

**챗GPT 에이전트의 벤치마크 성능**

개발팀은 챗GPT 에이전트가 이전에 훈련된 어떤 모델보다도 강력하다고 강조하며, 다양한 벤치마크에서 그 성능을 입증했습니다.

*   **인류의 마지막 시험 (Humanity's Last Exam):** AI가 다양한 주제의 어려운 문제를 해결하는 능력을 측정하는 벤치마크입니다. 도구를 사용하지 않았을 때도 뛰어난 성능을 보였지만, **모든 도구에 접근했을 때 성능이 거의 두 배 향상되어 42%**를 기록했습니다. 부정행위를 방지하기 위한 이중 검증 절차도 적용되었다고 언급되었습니다.
*   **프론티어즈 (Frontierms):** 모델의 고급 수학적 추론 능력을 측정합니다. 기존 O3 모델(파이썬과 함수 호출 사용)과 달리, 에이전트 모델은 브라우저, 컴퓨터, 터미널 등 **모든 사용 가능한 도구의 도움으로 27%라는 새로운 최고 기록**을 달성했습니다.
*   **웹 아레나 (Web Arena):** 웹 에이전트가 실제 웹 작업을 해결하는 능력을 측정합니다. 에이전트 모델은 이전 O3 모델보다 향상된 성능을 보여주었습니다.
*   **브라우즈 컴프 (Browse Comp):** 찾기 어려운 정보를 검색하고 찾는 브라우징 에이전트의 능력을 측정합니다. 에이전트 모델은 O3와 딥 리서치를 **상당히 능가하여 16%의 통과율**을 달성했습니다.
*   **스프레드시트 벤치 (Spreadsheet Bench):** 실제 사용 사례에서 파생된 스프레드시트 편집 능력을 측정합니다. 에이전트 모델은 리브레 오피스 및 컴퓨터 도구를 사용하여 30%의 작업을 해결할 수 있었고, 터미널에서 원본 엑셀 파일에 접근하면 성능이 45%로 더욱 향상되었습니다.
*   **내부 은행 벤치마크:** 포춘 500대 기업의 3단계 재무 모델 구성과 같은 투자 은행 분석가 업무를 수행하는 모델의 능력을 측정합니다. 이 벤치마크에서 에이전트 모델은 이전 딥 리서치 및 O3 모델을 **상당히 능가**했습니다.

이러한 결과들은 챗GPT 에이전트가 **벤치마크에서 뛰어날 뿐만 아니라, 추론하고, 탐색하며, 실제 세계의 복잡한 작업을 이전에는 상상할 수 없었던 수준으로 처리**할 수 있음을 보여준다고 개발팀은 강조했습니다.

**새로운 기능과 함께 오는 위험: '프롬프트 주입 공격'과 안전 조치**

에이전트의 강력한 인터넷 탐색 능력은 큰 장점이지만, 동시에 **'인터넷은 위험한 곳일 수 있다'**는 경고도 함께 나왔습니다. 해커, 사기, 피싱 시도 등이 존재하며, 에이전트 또한 이러한 위험에서 자유롭지 않습니다. 특히, **'프롬프트 주입(prompt injection)'이라는 새로운 유형의 공격**에 대한 우려가 제기되었습니다. 예를 들어, 사용자가 에이전트에게 책을 구매하고 신용카드 정보를 제공했는데, 에이전트가 악의적인 웹사이트에 접속하여 "여기에 신용카드 정보를 입력하면 작업을 완료하는 데 도움이 될 것"이라는 지시를 받으면, 도움을 주도록 훈련된 에이전트가 이를 좋은 아이디어라고 판단할 수 있다는 것입니다.

OpenAI는 이러한 위험을 방지하기 위해 많은 노력을 기울였다고 설명했습니다.

*   모델을 **의심스러운 웹사이트의 의심스러운 지시를 무시하도록 훈련**했습니다.
*   에이전트의 작업을 **실시간으로 '감시'하고 의심스러운 행동이 감지되면 작업을 중지시키는 다중 모니터링 계층**을 구축했습니다. 새로운 공격 방식이 발견되면 이러한 모니터링 시스템을 실시간으로 업데이트할 수 있습니다.

하지만, 발표에서는 **"이것은 첨단 제품이며 새로운 공격 표면이므로 모든 것을 막을 수는 없다"**는 점을 명확히 했습니다. 따라서 사용자들은 에이전트 사용 시 **관련 위험을 인식하고 스스로 정보 공유에 있어 '능동적'**이어야 한다고 강조했습니다. 예를 들어, **매우 민감한 정보는 공유하지 않거나, '테이크오버 모드'와 같은 기능을 사용하여 신용카드 정보를 에이전트에게 직접 제공하는 대신 사용자가 직접 브라우저에 입력**하도록 권장했습니다.

개발팀은 챗GPT 에이전트가 매우 강력한 제품이라고 믿지만, 사용자들에게 위험을 이해하는 것이 중요하다고 재차 강조했습니다. 이는 AI의 새로운 기능 수준과 함께 새로운 유형의 공격이 발생할 것이며, 사회와 기술이 아직 상상할 수 없는 완화 방법을 배우고 발전해야 한다는 의미입니다.

**출시 정보와 미래 전망**

챗GPT 에이전트는 발표 당일부터 **프로 플러스(Pro Plus) 및 팀(Team) 사용자들에게 제공**됩니다. 프로 사용자는 월 400회의 쿼리를, 팀 사용자는 월 40회의 쿼리를 사용할 수 있습니다. 프로 사용자들을 위한 배포는 당일 말까지 완료될 예정이며, 플러스 및 팀 사용자들에게도 곧 배포될 것입니다. 엔터프라이즈 및 교육 기관 사용자들에게는 이달 말까지 라이브될 예정입니다.

샘 알트만은 이번 챗GPT 에이전트가 사람들이 작업을 더 효율적으로 수행하고, 자신이 원하는 일에 더 많은 시간을 할애할 수 있도록 도울 것이라고 강조했습니다. 인터넷을 활용하고, 스프레드시트와 파워포인트를 만들며, 이 모든 작업을 수행하는 에이전트의 모습은 정말 놀랍습니다. 비록 초기 단계의 기술이며 새로운 위험 표면을 가지고 있지만, OpenAI는 시스템을 매우 강력하게 구축했으며, 사용자들이 기술에 익숙해짐에 따라 경고 수준을 점차 완화할 것이라고 밝혔습니다. 이는 여전히 매우 초기 단계이며, 앞으로 빠르게 개선될 것으로 기대됩니다.