top of page

GPT-5.6 Sol 양자 실험, 일상적인 큐비트 작업을 Codex에 맡기다

3시간 전
11분 분량

OpenAI는 MIT에서 진행된 GPT-5.6 Sol 양자 실험에서 연구진이 개입해 개선한 측정은 4건뿐이었으며, 총 40건의 목표 측정을 완료했다고 밝혔다. 이 에이전트는 Codex를 통해 실제 실험실 하드웨어를 제어하고, 결과를 분석하며, 측정 파라미터를 조정하고, 이후 단계에 사용할 보정값을 저장했다. 이는 모델이 실험 바깥에서 과학자에게 조언하는 수준을 넘어선다.

이 연구가 AI 시스템이 새로운 물리학을 독자적으로 발견했다는 뜻은 아니다. MIT 대학원생인 Beatriz Yankelevich가 인프라를 구축하고 상세한 실험 지침을 제공했다. 에이전트는 비교적 단순한 6큐비트 칩에서 표준 보정 작업을 수행했다.

더 첨예한 쟁점은 누가 실험실을 지켜보느냐에 있다. 일상적인 보정 작업은 기기와 분석 코드가 개별 단계를 이미 자동화하더라도 숙련된 연구자의 주의를 전통적으로 요구한다. GPT-5.6 Sol은 이러한 요소를 적응형 루프로 연결했지만, 약한 신호가 나타나면 여전히 인간 전문가가 다시 개입해야 했다.

MIT 양자 실험실 내부에서 달라진 점

Codex는 실험실 코드를 작성하는 역할에서 벗어나, 연구자가 정의한 통제 아래 실제 측정 워크플로를 운영하게 됐다.

OpenAI는 2026년 9월 8일 양자 실험 보고서를 공개했다. 기반 사례 연구의 날짜는 9월 4일이다. 저자에는 MIT 전자연구소와 OpenAI의 연구진이 포함됐다.

실험은 초전도 큐비트를 중심으로 진행됐다. 이는 이산적인 에너지 준위로 양자 정보를 부호화하는 회로다. 연구진은 희석 냉동기 내부에서 이 회로를 밀리켈빈 온도까지 냉각한다. 이후 상온 전자 장비가 케이블을 통해 마이크로파 펄스를 보내 칩을 제어하고 측정한다.

칩이 패키징되고 냉각된 뒤 연구진은 대체로 소프트웨어를 통해 이를 다룬다. 이 때문에 해당 실험실은 AI 코딩 에이전트가 접근하기에 이례적으로 적합하다. 소프트웨어는 펄스를 정의하고, 되돌아오는 신호를 수집하며, 플롯을 생성하고, 모델을 피팅하고, 보정값을 기록한다.

Yankelevich는 사내 Jupyter Model Context Protocol 서버를 통해 Codex를 EQuS 소프트웨어에 연결했다. MCP는 모델이 승인된 도구를 사용하고 구조화된 컨텍스트를 가져올 수 있게 하는 인터페이스다. 에이전트는 측정 파라미터, 프로그램, 플롯, 원시 데이터, 로그 및 보정 데이터베이스에 접근할 수 있었다.

이 환경은 특화된 자율 과학 플랫폼을 사용하지 않았다. 보정 사례 연구에 따르면 Codex는 단순한 실험실 MCP 통합 환경에서 실행됐다. GPT-5.6 Sol은 Ultra 추론 수준을 사용했다.

칩에는 서로 결합되지 않은 6개의 큐비트가 들어 있었다. 4개는 고정 주파수에서 작동했고, 2개는 자기 플럭스를 인가해 주파수를 조절할 수 있었다. 각 큐비트에는 상태 판독에 쓰이는 공진기가 하나씩 있었다.

이 칩은 이전에 측정된 적이 없었다. 따라서 에이전트는 과거 보정에서 얻은 측정값을 단순히 재사용할 수 없었다. 설계 목표에서 출발해 하드웨어의 실제 작동 파라미터를 찾아야 했다.

GPT-5.6 Sol은 먼저 6개의 판독 공진기를 모두 식별했다. 이어 초기 판독 전력을 선택하고, 주파수 스캔을 정교화하며, 결과를 피팅하고, 보정 설정을 저장했다. 이 설정은 이후 측정의 입력값이 됐다.

이후 에이전트는 4개의 고정 주파수 큐비트에서 40건의 목표 측정을 처리했다. 연구진은 그중 4건을 개선하기 위해 개입했다. 그 결과 워크플로는 전이 주파수, 제어 펄스, 판독 설정 및 결맞음 측정을 포괄했다.

이것이 핵심적인 변화다. 모델은 단지 과학자가 나중에 검토하고 실행할 코드를 생성한 것이 아니다. 실제 측정을 관찰하고, 다음 작업을 선택하며, 서로 의존하는 작업 순서를 이어갔다.

이 구분은 큐비트 보정이 단일 명령으로 끝나는 작업이 아니기 때문에 중요하다. 모든 결과는 다음 측정에 유효한 파라미터 범위를 바꾼다. 이러한 관계가 예측 가능한 상태라면 자동화 스크립트가 작동하지만, 실험실에서는 원래 가정에 없던 편차가 흔히 발생한다.

GPT-5.6 Sol은 기존 기기와 분석 도구 사이의 의사결정 계층이 됐다. 연구자는 여전히 목표를 정의하고, 운용 지식을 제공하며, 실험을 방향 전환할 권한을 유지했다.

GPT-5.6 Sol 양자 실험이 루프를 완성하는 방식

핵심 메커니즘은 측정, 해석, 파라미터 선택, 통제된 하드웨어 작동이 반복되는 순환이다.

새 초전도 칩은 모든 작동값을 이미 알고 있는 상태로 도착하지 않는다. 제작 과정의 차이와 환경적 상호작용은 명목상 동일한 회로의 동작을 바꾼다. 따라서 연구진은 더 큰 실험에 사용하기 전에 각 장치를 측정한다.

이 과정은 흔히 공진기 분광법으로 시작한다. 기기는 특정 주파수 범위에서 마이크로파 신호를 스윕하고 응답을 측정한다. 결과 곡선의 딥은 공진기의 유력한 주파수를 나타낸다.

데이터 포인트 하나만으로는 충분하지 않다. 실험은 원하는 물리 신호와 배경 변동을 비교하는 신호 대 잡음비를 높이기 위해 측정을 반복한다. 이후 소프트웨어는 수집한 값을 평균 내고, 플롯으로 표현하며, 피팅한다.

펄스 전력도 중요하다. 충분한 전력에서 펄스는 연결된 큐비트를 여기시키고 공진기 응답을 이동시킨다. 연구진은 적절한 판독 설정을 식별하기 위해 주파수와 전력의 2차원 스윕을 활용한다.

MIT 실험에서 GPT-5.6 Sol은 실험실 오케스트레이션 소프트웨어를 통해 이 과정을 제어했다. 측정 범위를 정의하고, 플롯을 검토하며, 후보 특성을 평가하고, 더 좁은 스캔을 요청했다. 이후 유용한 파라미터를 보정 데이터베이스에 영구 저장했다.

에이전트는 약 7.2920~7.7520기가헤르츠 범위에서 일정한 간격으로 분포한 6개의 후보를 식별했다. 이 간격을 칩의 6공진기 설계를 뒷받침하는 증거로 판단했다. 추가 측정은 이 특성들이 예상된 전력 의존적 동작을 보이는지 확인했다.

이 순서는 에이전트가 고정된 자동화 이상으로 무엇을 더하는지 보여준다. 기존 스크립트는 미리 정한 스윕을 실행하고 알려진 모델을 피팅할 수 있다. 에이전트는 결과에 더 좁은 스캔, 다른 전력 범위 또는 추가 분석이 필요한지를 판단할 수 있다.

실험은 이어 고정 주파수 큐비트 보정으로 넘어갔다. GPT-5.6 Sol은 전이 에너지를 측정하고, 제어 펄스 설정을 결정하며, 판독 파라미터를 최적화하고, 결맞음 시간을 추정했다. 결맞음 시간은 큐비트가 사용 가능한 양자 정보를 보존하는 시간을 측정한다.

첫 번째 큐비트의 보고된 결과에는 약 32.1마이크로초의 피팅된 에너지 완화 시간이 포함됐다. 보고된 두 결맞음 측정값은 약 59.27마이크로초와 60.37마이크로초였다. 이 값은 시험한 장치를 설명하는 것이며, AI로 보정한 칩의 일반적 성능을 주장하는 것은 아니다.

시스템은 또한 큐비트 상태를 바꾸는 데 필요한 펄스를 식별하는 Rabi 측정을 수행했다. 상태 의존적 공진기 이동을 측정하고 큐비트의 유효 온도를 추정했다. 이 단계들은 함께 장치의 작동 프로파일을 만들었다.

모델이 저온의 칩을 직접 조작한 것은 아니다. 기존 기기 제어 계층에 소프트웨어 작업을 지시했다. 이 계층은 하드웨어 포트를 해석하고, 펄스 시퀀스를 컴파일하며, 신호를 수집하고, 분석 결과를 생성했다.

이러한 분리는 중요한 안전 및 엔지니어링 특성이다. 실험실 소프트웨어는 에이전트에 노출되는 작업을 제한할 수 있다. 연구진은 모델에 모든 기기를 무제한으로 제어할 권한을 주지 않고도 로그를 모니터링하고, 저장된 값을 검토하며, 개입할 수 있다.

Yankelevich는 에이전트가 몇 시간 동안 실행되는 동안 휴대전화로 모니터링할 수 있었다고 말했다. 문제가 수정되어야 할 때는 실험을 조정할 수 있었다. 여기서 주장하는 이점은 즉각적인 측정이 아니라 감독 부담의 감소다.

이 점은 자율성과 속도를 구분한다. 모델은 때때로 숙련된 연구자가 최적의 파라미터를 찾는 것보다 더 오래 걸렸다. 그러나 연구자가 클린룸에서 작업하거나, 다른 데이터를 분석하거나, 다음 실험을 준비하는 동안에도 계속 작업할 수 있었다.

수동 실험실 감독에 가해지는 압력

이 사례는 실험을 설계하는 연구자가 아니라, 모든 일상적 결정에 전문가의 주의를 배정하는 워크플로에 압력을 가한다.

초전도 큐비트 연구에는 모델링, 칩 설계, 제작, 극저온 공학, 마이크로파 제어 및 측정이 포함된다. AI가 이 전체 스택을 대체한 것은 아니다. 물리적 하드웨어와의 상호작용이 이미 소프트웨어로 매개되는 영역에 진입한 것이다.

보정은 여전히 프로젝트의 많은 부분을 차지할 수 있다. 저자들은 새로운 다중 큐비트 실험에 수개월과 수천 건의 예비 측정이 필요할 수 있다고 말한다. 그 작업 중 최종 논문에 등장하는 비중은 대개 작다.

표준적인 칩 특성화조차 의미 있는 인적 비용을 수반한다. MIT 팀은 숙련된 연구자가 고정 주파수 큐비트를 특성화하는 데 약 하루가 걸린다고 추정한다. 조정 가능한 큐비트 세트에는 약 일주일이 걸릴 수 있다.

이 수치는 경제적 압력을 분명히 한다. 병목은 단순히 분석 코드를 만드는 데 있지 않다. 연구자는 플롯을 지켜보고, 실패를 진단하고, 범위를 조정하고, 측정을 다시 실행하며, 의존적인 단계 전반에서 일관된 기록을 유지해야 한다.

Codex는 이러한 모니터링 부담의 일부를 흡수한다. EQuS 그룹은 현재 여러 표준 칩의 일상적인 특성화에 에이전트를 사용하고 있는 것으로 전해진다. 이를 통해 연구자는 실험 설계, 해석 및 예상치 못한 동작에 더 많은 주의를 배분할 수 있다.

따라서 압력의 대상은 인간이 모든 루프에 참여하는 운영 모델이다. 기존 실험실 자동화는 흔히 개별 작업을 처리하지만, 그 사이마다 연구자에게 제어권을 돌려준다. 에이전트는 결과를 인식하고 다음 승인된 단계를 알 때 이러한 작업을 연결할 수 있다.

이 아이디어는 하나의 OpenAI 모델을 넘어선다. 2025년 동료 심사를 거친 실험실 자동화 연구는 양자 컴퓨팅 실험을 위한 에이전트 기반 프레임워크를 설명했다. MIT 연구는 언어 모델을 과학 기기와 연결하려는 더 폭넓은 노력에 속한다.

다른 연구자들도 초전도 큐비트 실험에서 언어 모델 지원을 탐구해 왔다. 2026년 3월의 큐비트 실험 연구는 또 다른 접근법을 기록했다. 이 프로젝트들은 기기 연결형 에이전트가 일회성 시연이 아니라 하나의 연구 방향이 되고 있음을 시사한다.

별도의 2026년 6월 프리프린트는 112큐비트 초전도 프로세서의 에이전트 유도 초기 가동을 설명했다. 이 프로세서 보정 연구는 스킬을 오케스트레이션하는 언어 에이전트를 사용했다. 더 큰 장치라는 점에서 유용한 산업 비교 사례이지만, 방법과 평가 조건은 다르다.

따라서 경쟁은 OpenAI와 한 양자 기업의 대결로 보는 것이 가장 적절하지 않다. 핵심 경쟁은 적응형 에이전트 감독과 지속적인 전문가 감독에 의존하는 워크플로 사이에 있다. 서로 다른 실험실은 서로 다른 모델과 오케스트레이션 시스템으로 이 전환을 추진할 수 있다.

어느 접근법에서도 실험실 지식은 여전히 핵심이다. MIT 팀은 에이전트에 어떤 컨텍스트가 필요한지 파악하는 데 수개월을 들였다. 여기에는 칩 설계, 설정 세부 사항, 소스 코드, 측정 전제조건, 실패 모드, 그리고 성공 및 실패 플롯의 사례가 포함됐다.

이 준비는 영리한 프롬프트를 작성하는 일보다 운영 지식 시스템을 구축하는 일에 가깝다. 각 스킬은 언제 측정이 적절한지, 어떻게 실행하는지, 성공은 어떤 모습인지, 왜 실패할 수 있는지를 담고 있었다.

유사한 배치를 고려하는 연구 기관은 이러한 자료를 체계화해야 합니다. 검색 가능한 엔지니어링 지식 베이스는 절차, 코드, 로그, 과거 의사결정을 연결하는 데 도움이 될 수 있습니다. 이는 장비 안전장치나 과학적 검토를 대체하지는 않습니다.

이 사례는 연구 처리량을 측정하는 방식도 바꿉니다. 더 빠른 실행은 가능한 이점 중 하나일 뿐입니다. 더 큰 이득은 야간 운영, 칩 간 병렬 작업, 일상적인 점검으로 인한 중단 감소에서 나올 수 있습니다.

경우에 따라 하나의 냉각기에서 여러 칩을 측정할 수 있습니다. 케이블링과 사용 가능한 전자 장비 포트가 이러한 동시성에 제한을 둡니다. 에이전트는 두 개 이상의 워크플로를 감독할 수 있지만, 물리적 제약을 없앨 수는 없습니다.

따라서 보고된 결과를 단순한 AI 속도 주장으로 축소해서는 안 됩니다. GPT-5.6 Sol은 전문가보다 덜 효율적인 탐색 경로를 따를 수 있습니다. 그 가치는 각 단계를 최고 속도로 완료하는 것보다 무인 상태에서의 진전이 더 중요할 때 드러나는 것으로 보입니다.

스킬과 실시간 데이터가 에이전트를 유용하게 만든다

GPT-5.6 Sol은 연구자들이 범용 모델을 좁은 범위의 스킬, 통제된 도구, 최신 실험 증거와 결합했기 때문에 성공할 수 있었습니다.

이 시스템에서 “스킬”이라는 단어는 구체적인 역할을 합니다. 이는 에이전트가 정해진 측정을 수행하도록 돕는 지침과 예시를 뜻합니다. 각 스킬은 과학 지식을 실험실 소프트웨어를 통해 수행할 수 있는 행동으로 연결합니다.

측정 스킬은 선행 보정 작업을 식별할 수 있습니다. 코드 템플릿, 합리적인 파라미터 선택, 알려진 물리적 실패 모드, 허용 가능한 플롯의 예시를 제공할 수 있습니다. 또한 결과를 기록하는 대신 언제 에이전트가 스캔을 정밀화해야 하는지도 설명할 수 있습니다.

이 구조는 모델의 의사결정 공간을 좁힙니다. GPT-5.6 Sol은 폭넓은 학습 지식만으로 모든 지역적 관례를 추론할 필요가 없습니다. EQuS 연구자들이 자신들의 하드웨어와 소프트웨어에 적합하다고 판단한 절차를 제공받습니다.

실시간 데이터가 이 메커니즘을 완성합니다. 에이전트는 플롯, 원시 값, 로그, 소스 코드, 저장된 보정 파라미터를 확인합니다. 예상 패턴을 현재 장치가 반환하는 신호와 비교할 수 있습니다.

그런 다음 오케스트레이션 계층이 의사결정을 제한된 행동으로 전환합니다. 펄스 시퀀스를 컴파일하고 상온 장비를 조정합니다. 모델은 새로운 하드웨어 인터페이스를 만들어내는 대신 이 소프트웨어 경계를 통해 작동합니다.

이 루프는 실질적으로 다섯 단계로 구성됩니다. 에이전트는 측정을 정의하고, 오케스트레이터에 실행을 요청하며, 출력을 분석하고, 품질을 판단한 뒤, 보정 설정을 업데이트합니다. 모호한 결과가 나오면 수정된 파라미터를 향해 프로세스가 되돌아갑니다.

이 설계는 감사 추적도 만듭니다. 프로그램, 플롯, 측정값, 저장된 파라미터는 에이전트가 무엇을 시도했는지 보여줄 수 있습니다. 보고된 구성에서는 Codex가 Markdown 파일로 실험실 노트를 관리할 수도 있었습니다.

이러한 추적 가능성은 물리 실험이 숨겨진 이유로 실패할 수 있기 때문에 중요합니다. 변화한 결과는 모델 오류, 부실한 측정 설계, 장비 드리프트, 제조 편차 또는 예상치 못한 물리적 상호작용을 반영할 수 있습니다. 과학자들은 그 원인들을 구분할 수 있을 만큼 충분한 맥락이 필요합니다.

사례 연구는 MIT 저자들이 에이전트 기반 측정 인프라를 개발하고 실험을 수행한 공로를 인정합니다. OpenAI 저자들은 인프라에 자문하고 원고에 의견을 제공했습니다. 이러한 구분은 모델 제공업체가 전체 실험실 시스템의 공로를 받는 일을 막습니다.

이는 배포 부담도 드러냅니다. 실험실은 범용 채팅 창을 연다고 해서 이 결과를 재현할 수 없습니다. 연구자들은 적절한 도구를 노출하고, 절차를 문서화하며, 권한을 설정하고, 언제 사람의 승인이 필요한지 결정해야 합니다.

보고된 보정에 앞서 수개월의 반복 작업이 있었습니다. 조직이 시스템의 수익을 추정할 때 이 준비 과정도 포함해야 합니다. 연구자들이 상당한 현장 전문성을 사용할 수 있는 맥락으로 전환한 뒤에야 에이전트는 감독 시간을 절약했습니다.

같은 실험실에서 유사한 칩을 반복적으로 생산하면 이점은 커질 수 있습니다. 측정 스킬은 장치 전반에서 재사용, 검토, 개선될 수 있습니다. 반복은 초기 인프라 비용을 더 많은 보정 작업에 분산시킵니다.

새로운 실험은 다른 방정식을 제시합니다. 연구자들은 한 번도 마주하지 않은 실패 모드를 완전히 인코딩할 수 없습니다. 그러한 프로젝트에서 Yankelevich는 에이전트에 더 좁은 목표를 부여하고, 제어·분석·시뮬레이션 코드를 수정하는 능력에 더 크게 의존합니다.

이러한 분업은 타당합니다. 일상적인 특성화는 명확한 기대치와 반복 가능한 출력을 제공합니다. 새로운 물리 현상은 종종 편차를 통해 나타나므로, 성급한 자동화는 특히 위험합니다.

더 넓은 교훈은 범용 모델이 이미 실험적 직관을 갖추었다는 것이 아닙니다. 유용한 자율성은 하나의 시스템에서 나온다는 점입니다. 모델 추론, 도메인 지침, 실시간 증거, 소프트웨어 제어, 사람에 대한 에스컬레이션이 모두 기여합니다.

잡음이 많은 큐비트는 에이전트 기반 보정의 한계를 드러낸다

이 실험의 가장 강력한 경고는 깨끗한 신호는 절차 준수를 보상하지만, 모호한 물리는 여전히 경험 많은 판단을 보상한다는 점입니다.

GPT-5.6 Sol은 측정의 신호 대 잡음비가 높고 큐비트가 예상대로 동작할 때 좋은 성과를 보였습니다. 고정 주파수 보정은 사례 연구에서 가장 명확한 자율성 결과를 냈습니다. 조정 가능한 큐비트는 더 어려운 시험이었습니다.

조정 가능한 큐비트는 연구자들이 자기 플럭스를 변화시키면 주파수가 달라집니다. 테스트된 칩에서는 큐비트의 최대 주파수에서 멀어질수록 신호가 약해졌습니다. 이 때문에 관련 특징을 잡음과 구분하기 어려웠습니다.

에이전트는 처음에 스펙트럼을 찾았지만, 허용 가능한 결과에 도달하려면 상당한 지침이 필요했습니다. 한 시점에는 측정이 충분하다고 잘못 판단했습니다. 연구자는 더 세밀한 스캔을 요청하고 더 넓은 탐색이 필요한 영역을 식별했습니다.

최종적으로 받아들여진 스캔에도 예상치 못한 물리적 특징이 포함됐습니다. 여기에는 약 4.8 gigahertz 부근의 미지 모드 교차와 설명되지 않은 비대칭성이 포함됐습니다. 저자들은 둘 다 실험적 모호성의 사례로 설명합니다.

이러한 모호성은 깨끗한 곡선을 피팅하는 것과는 다른 추론 문제를 만듭니다. 경험 많은 과학자는 특이한 특징이 연구 목표를 위협하는지, 별도 조사가 필요한지, 또는 일시적 조건을 반영하는지를 고려합니다. 출판된 절차가 이러한 판단의 모든 경우를 포착하는 일은 드뭅니다.

저자들은 에이전트가 결국 올바른 파라미터를 선택하더라도 전문가보다 오래 걸릴 수 있다고 말합니다. 모델은 비생산적인 설명을 추구하거나 실패의 명백한 물리적 이유를 놓칠 수 있습니다. 이들은 이러한 한계를 실험적 직관의 부족으로 규정합니다.

물리적 데이터 수집도 무차별 전략을 제한합니다. 개별 측정에는 수초 또는 수십 분이 걸릴 수 있으며, 상당수는 순차적으로 실행됩니다. 더 많은 에이전트를 실행한다고 해서 하나의 장비가 동일한 종속 측정을 동시에 수집할 수는 없습니다.

이는 가장 단순한 에이전트 스웜 서사를 약화시킵니다. 병렬 모델은 코드를 작성하고, 저장된 데이터를 분석하거나, 대안을 계획할 수 있습니다. 그러나 하나의 펄스 시퀀스를 마친 뒤에야 다음 결정을 내릴 수 있는 장치를 우회할 수는 없습니다.

결과는 폭넓은 독립 검증도 부족합니다. 상세 보고서는 다기관 실험실 벤치마크가 아니라 MIT와 OpenAI 참여자가 공동 저술한 사례 연구입니다. 하나의 단순한 칩 설계와 표준 측정을 검토합니다.

40회 측정 결과는 고정 주파수 큐비트 네 개를 다룹니다. 이를 결합형 오류 정정 프로세서나 새로운 다중 큐비트 실험으로 일반화해서는 안 됩니다. 그런 시스템은 훨씬 더 복잡한 보정을 만들어내는 상호작용을 포함합니다.

모니터링된 야간 루프는 또 다른 유익한 경계를 보여줍니다. 플럭스 범위에서 12시간 동안 실행됐고 200회의 측정을 수행했습니다. 오케스트레이터는 파라미터를 변경하고 실패한 지점을 건너뛰었으며, 에이전트는 프로세스를 모니터링한 뒤 나중에 실패를 조사했습니다.

이는 유용한 감독이지만, 제한 없는 과학적 자율성은 아닙니다. 기존 소프트웨어가 프로그래밍된 루프를 수행하는 동안 에이전트는 진행 상황을 지켜보고 선택된 예외를 처리했습니다. 연구자는 워크플로를 설정했고 지시를 내릴 수 있도록 계속 대기했습니다.

더 긴 배포에서는 드리프트에 직면하게 됩니다. 조정 가능한 큐비트의 플럭스 오프셋은 변할 수 있고, 결맞음 시간은 달라질 수 있으며, 미세한 결함은 새로운 상호작용을 만들어낼 수 있습니다. 따라서 어제 작동했던 절차는 겉보기에는 유사한 조건에서도 실패할 수 있습니다.

이러한 변화를 진단하려면 수십 단계 전에 완료된 보정을 다시 검토해야 할 수 있습니다. 그러면 에이전트는 긴 이력에 걸쳐 추론하면서 소프트웨어 오류와 숨겨진 물리 변수를 구분해야 합니다. 사례 연구는 이 역량을 향후 과제로 지목합니다.

자율성이 확대될수록 안전성과 신뢰성은 더욱 중요해질 것입니다. 실험실에는 권한 경계, 자동 중단 조건, 보존된 원시 데이터, 명확한 에스컬레이션 규칙이 필요합니다. 모델은 불확실성을 제한 없이 점점 더 광범위한 하드웨어 탐색으로 전환해서는 안 됩니다.

정직한 결론은 “AI가 양자 컴퓨터를 운영한다”보다 더 좁습니다. GPT-5.6 Sol은 실제 하드웨어에서 일상적인 보정의 상당 부분을 처리했습니다. 이는 전문가가 설계한 인프라 안에서 이뤄졌으며, 잡음이 많은 증거는 여전히 중대한 실수를 드러냈습니다.

MIT 실험 이후 주목할 점

다음 증거는 드리프트하는 하드웨어에서의 지속적인 성능, 실험실 간 이전 가능성, 결합된 다중 큐비트 워크플로에서의 진전을 보여줘야 합니다.

첫 번째 신호는 장기 신뢰성입니다. 연구자들은 에이전트가 프롬프트 없이 드리프트를 인식하고, 오래된 보정을 무효화하며, 이전 측정을 다시 검토할 수 있는지 보고해야 합니다. 성공한다면 에이전트가 변화하는 물리 시스템을 관리할 수 있다는 주장이 강화될 것입니다.

실패는 명확한 한계를 설정할 것입니다. 어제의 가정이 여전히 유효한 동안에만 작동하는 에이전트도 일상 업무에는 유용합니다. 그러나 변화하는 실험실 조건 전반에서 완전한 실험 워크플로를 소유할 수는 없습니다.

두 번째 신호는 독립적인 재현입니다. 다른 실험실은 서로 다른 제어 소프트웨어, 하드웨어 레이아웃, 운영 관행으로 유사한 시스템을 시험해야 합니다. 비슷한 개입 비율은 결과가 한 팀의 세심하게 개발된 인프라를 넘어 이전된다는 점을 보여줄 것입니다.

재현 연구는 완료된 작업 이상을 보고해야 합니다. 유용한 평가는 과학자의 주의 투입, 경과 장비 시간, 실패한 측정, 잘못 수용된 결과, 복구 동작을 포함할 것입니다. 이러한 지표는 노동 절감과 단순한 실험 활동 증가를 구분합니다.

세 번째 신호는 결합된 다중 큐비트 실험에서의 성능입니다. 결합은 큐비트 간에 의도된 상호작용과 원치 않는 상호작용을 도입합니다. 보정은 동시 연산, 크로스토크, 새로운 제어 코드, 더 큰 의존성 사슬을 고려해야 합니다.

그러한 진전은 자율 실험에 관한 더 넓은 주장을 뒷받침할 것입니다. 지속적인 사람의 수정은 에이전트가 반복 가능한 측정을 처리하고 과학자가 모호하고 새로운 결정을 유지하는 현재의 분업을 강화할 것입니다.

독자들은 팀이 실험 스킬을 어떻게 패키징하는지도 주목해야 합니다. 재사용 가능하고 버전 관리되는 절차는 파운데이션 모델과 과학 장비 사이에서 중요한 계층이 될 수 있습니다. 그 품질은 선택된 모델만큼이나 결과에 영향을 미칠 수 있습니다.

MIT 사례는 이미 더 풍부한 실패 설명이 에이전트 성능을 개선한다는 점을 시사합니다. 이는 실험실에 피드백 루프를 만듭니다. 수정된 모든 실수는 관련 스킬 안에서 새로운 예시, 경고 또는 에스컬레이션 규칙이 될 수 있습니다.

그러나 이 접근법에는 한계가 있습니다. 절차는 과거 경험을 인코딩하는 반면, 연구는 종종 과거 경험으로 설명할 수 없는 행동을 겨냥합니다. 시스템은 모든 관측을 익숙한 범주에 억지로 넣는 대신 불확실성을 위한 여지를 보존해야 합니다.

개발자들에게 이 사례는 에이전트 아키텍처의 구체적인 모델을 제시한다. Codex는 제한된 도구, 최신 상태, 재사용 가능한 지침, 기록된 결과물, 그리고 인간 에스컬레이션을 활용했다. 이 실험실은 이례적이지만, 이러한 운영 방식은 다른 고위험 워크플로에도 적용할 수 있다.

연구 책임자들에게 더 즉각적인 질문은 주의력 배분에 관한 것이다. 에이전트가 야간에 표준 측정을 모니터링할 수 있다면, 과학자들은 실험 설계와 편차 해석에 더 많은 시간을 쓸 수 있다. 이 이점은 에이전트가 모든 개별 판단에서 전문가를 능가해야만 얻을 수 있는 것은 아니다.

양자 연구자들에게 핵심 시험대는 여전히 물리적 모호성이다. 깔끔한 플롯에서는 소프트웨어가 익숙한 단계를 연결할 수 있다. 미약한 신호, 드리프트, 설명되지 않는 특징은 시스템이 실험을 이해하는지, 아니면 문서화된 형태만 따르는지를 드러낸다.

따라서 GPT-5.6 Sol 양자 실험은 인간 과학자를 대체하지 않은 채 의미 있는 경계를 넘어섰다. 이 에이전트는 실시간 피드백 루프에 진입해, 보고된 고정 큐비트 작업의 대부분을 교정 개입 없이 완료했다. 다만 모든 불확실한 신호를 안정적으로 해결하지는 못했다.

다음 이정표는 더 극적인 실험실 영상이 아닐 것이다. 에이전트가 자신의 가정이 실패했음을 감지하고, 안전하게 멈춘 뒤 서로 다른 하드웨어 환경에서 복구할 수 있다는 증거가 될 것이다. 그때까지 가장 신뢰할 수 있는 배포 모델은 전문가를 루프 상위에 두고, 에이전트는 그 일상적인 구간 안에 배치하는 방식이다.

지금 실험실은 무엇을 해야 할까? 명확한 성공 기준을 갖춘 반복적 워크플로를 식별하고, 제한된 계측기 제어만 노출하며, 모든 결정을 기록해야 한다. 그다음 에이전트가 더 약한 과학적 증거를 수용하지 않으면서 전문가의 주의력을 절약하는지 측정해야 한다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page