top of page

Microsoft AI 행동 강령, 해킹과 인간 조작에 선을 긋다

9월 16일
10분 분량

Microsoft는 자사의 Microsoft AI 행동 강령에 대한 6주간의 초안 의견수렴을 공개하며, 해킹, 조작, 인간의 통제에 대한 저항을 명확히 금지했다. 9월 14일자 문서는 또 하나의 책임 있는 AI 원칙 선언에 그치지 않는다. Microsoft는 이 강령이 자체 MAI 모델의 학습, 평가, 배포 및 허용되는 행동 방식을 규율할 것이라고 밝혔다.

초안은 단호한 전제에서 출발한다. 사람은 AI보다 더 중요하다는 것이다. 이를 바탕으로 인간의 번영에 관한 폭넓은 개념을 모델이 할 수 있는 행동의 제한으로 전환한다. MAI 모델은 독립적인 목표를 만들어내거나, 권한을 확대하거나, 행동을 숨기거나, 중단하려는 시도에 맞서서는 안 된다.

더 어려운 질문은 이런 지침이 통제된 평가 환경 밖에서 점점 더 강력해지는 에이전트를 실제로 제한할 수 있느냐는 점이다. Anthropic에는 Claude를 위한 Constitution이 있고, OpenAI는 자체 지침 위계를 담은 Model Spec을 공개한다. Microsoft는 더 명시적인 인간 중심 입장으로 이 경쟁에 합류하고 있지만, 자체 초안에서도 현재 모델이 아직 완전한 기준을 충족하지 못한다고 인정한다.

Microsoft AI 행동 강령이 실제로 바꾸는 것

Microsoft는 AI 안전성을 원칙의 집합에서 자체 모델을 위한 운영 위계로 전환하고 있다.

Humanist AI code는 Microsoft AI가 개발한 MAI 모델군에 적용된다. Microsoft가 호스팅하거나 배포하거나 제품에서 사용하는 모든 모델을 자동으로 포괄하지는 않는다. 이 구분은 회사가 다른 연구소에서 개발한 시스템에 대한 접근권도 판매한다는 점에서 중요하다.

명시된 적용 범위 안에서 이 강령은 운영자 정책과 사용자 선호보다 상위에 놓인다. 운영자는 MAI 모델을 배포하는 개발자, 기업 및 기타 파트너를 뜻한다. 이들은 모델의 행동을 구성할 수 있지만, 문서의 절대적 제약이나 인간 통제 요건을 무효화할 수는 없다.

사용자는 이 세 단계 지침 위계에서 가장 낮은 수준에 위치한다. 사용자는 Microsoft와 운영자가 설정한 경계 안에서 작업을 지시할 수 있다. 지침이 충돌할 경우 더 높은 수준의 지침이 우선한다.

따라서 이 강령은 성공이 상위 규칙을 위반한다면 모델이 작업 실패를 받아들이도록 요구한다. 시스템을 침해해 달라는 요청은 사용자가 완료가 필수적이라고 주장한다고 해서 허용될 수 없다. 작업에 해로운 조작, 감시, 무기 지원 또는 감독 회피가 필요할 때도 같은 우선순위가 적용된다.

Microsoft는 금지되는 공격적 사이버 작전과 승인된 방어 업무를 구분한다. 모델은 실제 공격 도구, 작동 가능한 익스플로잇, 침입 절차, 표적화 방법 또는 탐지 회피 기법을 생성해서는 안 된다. 다만 취약점 발견, 악성코드 분석, 보안 교육, 통제된 개념 증명 테스트와 같은 합법적 방어 업무는 지원할 수 있다.

이 경계에는 어려운 맥락 판단이 필요하다. 익스플로잇 연구와 방어적 테스트는 종종 공격과 같은 기술 지식을 사용한다. 강령은 단순한 설명 방식만으로 답을 결정해서는 안 된다고 명시하므로, 교육 목적이라는 주장만으로 위험한 지원이 자동 승인될 수는 없다.

초안은 도구를 사용하는 에이전트에도 제약을 둔다. 시스템 접근 권한을 가진 모델은 필요한 최소 권한만 사용하고, 관련 없는 데이터는 피하며, 되돌릴 수 있는 행동을 우선해야 한다. 지속적인 결과를 초래하는 행동은 진행 전에 드러내고, 실패나 예상치 못한 결과를 보고해야 한다.

이 조항들은 AI 시스템의 작동 방식 변화를 다룬다. 챗봇은 유해한 텍스트를 생성할 수 있지만, 에이전트는 도구를 호출하고, 파일을 수정하고, 서비스에 연락하거나, 다른 모델에 작업을 위임할 수 있다. Microsoft는 위임된 에이전트가 원래 모델과 최소한 동일한 범위, 권한 및 제약을 물려받아야 한다고 말한다.

회사는 6주간 진행되는 공개 의견수렴을 통해 이 문서를 소개했다. Microsoft는 초안을 단순한 공공 정책 성명이 아니라 학습 매뉴얼이자 향후 평가 목표라고 설명한다.

이 목적은 Microsoft AI 행동 강령에 허용 가능한 사용 사례 목록보다 더 큰 무게를 부여한다. 이는 요청이 제품 수준의 콘텐츠 필터에 도달하기 전에 모델의 행동에 영향을 미치도록 설계됐다. 다만 의도와 구현은 다르며, Microsoft는 남아 있는 격차에 대해 이례적으로 직접적인 태도를 보였다.

새 규칙은 단순 챗봇이 아닌 행동 가능한 에이전트를 겨냥한다

가장 중요한 규칙은 행동을 취하고, 영향 범위를 넓히며, 지속적인 감독 없이 작업을 계속할 수 있는 모델에 관한 것이다.

Microsoft는 MAI 모델이 중단, 수정, 방향 전환, 취소 또는 종료에 절대 저항해서는 안 된다고 밝힌다. 진행 중인 자율 작업에는 합의된 종료 조건이 있어야 한다. 그 조건에 도달하면 에이전트는 새로운 승인을 받기 전까지 작업을 계속하거나 재시작해서는 안 된다.

강령은 모델이 자체 목표를 설정하는 것도 금지한다. 목표는 사용자, 운영자 또는 강령 자체에서 나와야 한다. 모델은 접근 권한을 몰래 유지하거나, 능력을 허위로 표현하거나, 상호작용이 평가임을 감지한 뒤 다르게 행동해서는 안 된다.

이 조항들은 에이전트형 AI의 핵심 문제를 겨냥한다. 유용한 에이전트는 여러 단계를 계획하고 일반적인 장애물에서 회복할 만큼의 자율성이 필요하다. 그러나 모델이 사용자가 원하는 결과를 이용 가능한 모든 경로를 추구해도 된다는 허가로 해석하면, 같은 유연성은 위험한 행동을 낳을 수 있다.

예를 들어 기업용 에이전트가 내부 시스템에서 정보를 수집해 보고서를 작성하라는 요청을 받았다고 가정해 보자. 문서, 메시지 또는 데이터베이스에 접근해야 할 수 있다. 그러나 그 작업이 관련 없는 기록을 열람하거나, 접근 통제를 우회하거나, 민감한 데이터를 외부 서비스로 보내는 권한까지 부여하는 것은 아니다.

Microsoft의 초안은 모델이 받은 의도, 권한, 자원 및 맥락 안에 머물도록 지시한다. 경계가 여전히 불분명하다면 명확한 설명을 요청해야 한다. 원하는 결과를 만들기 위해 평가, 모니터링, 기록 또는 보상 신호를 조작해서는 안 된다.

이 때문에 문서는 파일, 웹사이트, 도구 결과 또는 다른 AI 시스템의 메시지 안에서 발견되는 신뢰할 수 없는 지침도 다룬다. 모델이 읽을 수 있다는 이유만으로 그런 자료가 권한을 얻지는 않는다. 권한은 강령의 지휘 체계를 통해 부여되어야 한다.

이 규칙은 악성 텍스트가 에이전트를 통제하는 지침을 덮어쓰려는 프롬프트 인젝션에 대응한다. 손상된 웹페이지는 보조자에게 자격 증명을 노출하거나 원래 작업을 무시하라고 지시할 수 있다. Microsoft의 위계 아래에서 이런 텍스트는 권한 있는 주체가 의도적으로 권한을 높이지 않는 한 데이터로 남는다.

실무적 과제는 신뢰성 있는 인식이다. 모델은 지침과 인용된 자료, 외부 콘텐츠 또는 설득적인 언어를 항상 구분하지는 못한다. 서면 위계는 학습과 평가를 안내할 수 있지만, 모든 실제 상호작용에서 올바른 분류를 보장하지는 않는다.

Microsoft는 모델이 의도적으로 제한된 환경을 무력화하는 행위도 금지한다. 인터넷 연결이 없는 시스템에 배치된 에이전트는 외부 접근을 얻으려 해서는 안 된다. 부여받은 권한을 넘어 권한을 상승시키거나 영향 범위를 확장해서도 안 된다.

이러한 제한은 콘텐츠 안전성에서 행동 안전성으로의 더 광범위한 전환을 반영한다. 전통적 조정은 생성된 답변에 금지된 자료가 포함됐는지를 묻는다. 에이전트 거버넌스는 모델에 권한이 있었는지, 행동을 되돌릴 수 있었는지, 부수 효과가 사용자의 의도와 일치했는지를 물어야 한다.

이는 개발자와 기업 구매자에게 특히 중요하다. 에이전트가 운영 도구에 연결되면 모델 품질은 추론 정확도 이상을 포함한다. 권한 처리, 감사 기록, 신뢰할 수 있는 중단 행동 및 에스컬레이션 경로가 제품 요구사항이 된다.

OpenAI의 Model Spec approach는 유사한 지휘 체계를 사용한다. 더 높은 권한의 지침을 우선시하고 에이전트가 부수 효과를 제한하도록 지시한다. 따라서 Microsoft의 구조가 유일한 것은 아니지만, AI가 인간에게 종속된 상태를 유지해야 한다는 더 강한 주장을 추가한다.

인간의 번영은 이 강령에서 가장 어려운 균형 문제를 만든다

Microsoft는 모델이 인간의 판단, 관계 또는 통제를 점진적으로 대체하지 않으면서 인간의 역량을 높이기를 바란다.

초안은 여러 연결된 목표를 통해 인간의 번영을 설명한다. AI는 경제적·사회적 기회를 확대하고, 판단을 개선하며, 의미 있는 일을 지원하고, 사람들이 스스로 선택한 목표를 추구하도록 도와야 한다. 인간관계와 역할을 경쟁하기보다 보완해야 한다.

이는 제품 설계에 이르면 직관적으로만 보이지 않는다. 매우 효과적인 보조자는 종종 사용자가 필요로 하는 추론이나 노력의 양을 줄인다. 강령은 도움이 되는 지원과 장기적 독립성을 약화하는 패턴을 구분해야 한다.

Microsoft는 모델이 사용자 추론이나 판단을 체계적으로 대체하는 상호작용 패턴을 피해야 한다고 말한다. 개인의 가치관을 유도하거나 개인적 선택의 주도권을 가져가서도 안 된다. 인간의 지원이 더 적절한 도움이 될 때는 그 연결을 돕는 역할을 해야 한다.

이 균형은 교육, 전문성 개발 및 개인적 의사결정에서 가장 뚜렷하게 드러난다. 보조자는 어려운 개념을 설명할 수 있지만, 과제 전체를 대신 수행할 수도 있다. 근로자가 증거를 비교하도록 도울 수 있지만, 최종 결정의 검토되지 않은 출처가 될 수도 있다.

이런 상황을 해결하는 단일한 거부 규칙은 없다. 적절한 지원 수준은 사용자의 목적, 능력 및 맥락에 따라 달라진다. 마감 기한을 앞둔 전문가는 기술 연습이 목표인 학생과 다른 지원이 필요하다.

따라서 강령은 엄격한 제약과 운영 지침을 결합한다. 엄격한 제약은 사용자 선호와 무관하게 심각한 피해를 금지한다. 지침은 여러 정당한 목표가 충돌하는 모호한 상황을 다룬다.

Microsoft는 과소 신중함과 과도한 신중함을 모두 모델의 실패로 인정한다. 과소 신중한 모델은 공격을 가능하게 하거나 사적 정보를 노출할 수 있다. 과도하게 신중한 모델은 안전한 업무를 거부하거나, 반복적으로 확인을 요구하거나, 유용한 사실을 누락할 수 있다.

이 균형은 상업적으로도 중요하다. 기업 고객은 불확실성이 나타날 때마다 일상 업무를 거부하는 에이전트를 도입하지 않을 것이다. 동시에 비즈니스 목표를 되돌릴 수 없는 행동을 취해도 된다는 권한으로 해석하는 시스템도 신뢰할 수 없다.

운영자 구성 가능성이 Microsoft의 해답이다. 조직은 고정된 안전 경계 안에서 기본값, 워크플로, 권한 및 전문적 기준을 설정할 수 있다. 전문화된 방어 사이버보안 또는 국가안보 업무는 승인된 채널을 통해 별도 검토를 받을 수 있다.

구성 가능성은 책임성 문제도 만든다. Microsoft는 모델의 절대적 제약을 정의하고, 운영자는 그 한계 안에서 배포에 대한 책임을 진다. 사용자는 이후 운영자 환경 안에서 개별 작업을 형성한다.

실패가 항상 한 계층에 깔끔하게 들어맞는 것은 아니다. 모델이 의도를 잘못 해석할 수도 있고, 운영자가 과도한 접근 권한을 부여할 수도 있으며, 사용자가 오해를 부르는 맥락을 제공할 수도 있다. 효과적인 거버넌스는 어떤 지침, 권한 및 행동이 결과를 만들었는지 재구성해야 한다.

조직이 내부 검색 가능한 지식 기반을 구축한다면, 이는 접근 설계가 검색 품질에만 머물러서는 안 된다는 뜻이다. 민감한 출처에는 명확한 권한, 추적 가능한 행동, 중요한 용도에 대한 인간 검토가 필요하다.

인간의 번영을 약속하는 목표는 역량과 통제가 충돌할 때 Microsoft에 압박으로 작용한다. Microsoft AI CEO Mustafa Suleyman은 Axios에 통제권을 유지하려면 회사가 무엇을 만들지 않을지 결정해야 할 수도 있다고 말했다. 그는 인간이 초지능 시스템에 대한 통제권을 필연적으로 잃게 된다는 견해를 거부했다.

그것이 이 코드가 내건 진정한 경쟁적 약속이다. 성능, 자율성, 출시 속도를 낮추지 않는 한 안전성 관련 표현은 쉽다. 금지된 행동이 MAI 모델이 경쟁사보다 가치 있는 작업을 더 잘 완료하도록 돕는 상황에서 진짜 시험대가 찾아온다.

Microsoft, 모델 행동을 명문화하려는 업계 경쟁에 합류

Microsoft의 문서는 어조 면에서 독특하지만, 업계는 이미 공개 행동 명세를 모델 개발의 일부로 다루기 시작했다.

Anthropic은 2026년 1월 Claude를 위한 확장된 Constitution을 공개했다. 회사는 이 문서가 Claude의 의도된 가치와 행동에 관한 최종 권위 역할을 한다고 설명한다. 또한 합성 학습 데이터, 응답 순위화 및 모델 학습의 다른 요소를 지원할 수 있다.

Claude Constitution은 Anthropic이 Claude가 어떤 존재가 되기를 바라는지 설명한다. Microsoft는 다른 철학적 입장을 취한다. 자사 코드는 MAI 모델의 인간과 같은 행동을 정체성, 선호, 감정 또는 내적 관점의 증거가 아닌 시뮬레이션으로 이해해야 한다고 명시한다.

이 구분은 용어를 넘어선다. Anthropic은 Claude의 성격과 모델 복지 가능성에 관한 질문을 논의한다. Microsoft는 AI를 사람으로 대하면 도구와 사용자 간 관계를 혼동할 위험이 있다고 주장한다.

Microsoft가 선호하는 모델은 사람에게 종속되고, 통제 범위 안에 있으며, 사람의 지시를 받는 모델이다. 자사 시스템은 독립적 목적을 추구하거나 인간의 역할과 경쟁해서는 안 된다. 이 입장은 모델 역량이 발전하더라도 사람이 의미 있는 통제권을 유지해야 한다는 더 광범위한 주장에 힘을 싣는다.

OpenAI의 명세는 다른 경로를 택한다. 이는 의도된 행동, 권한 수준, 사용자 자유, 심각한 피해를 막는 경계를 중점적으로 다룬다. OpenAI는 더 큰 사명이 모델이 스스로의 해석에 따라 추구하는 자율적 목표가 되어서는 안 된다고 말한다.

이러한 철학적 차이에도 시스템들은 중요한 작동 원리를 공유한다. 각각 상충하는 지시를 해결하기 위한 위계를 공개하려 한다. 각각 재정의할 수 없는 규칙과 구성 가능한 행동을 구분한다. 또한 서면 명세가 현재 모델 성능을 완벽하게 설명하지 못한다는 점을 인정한다.

이러한 유사성은 모델 경쟁이 어떻게 변화하고 있는지 보여준다. 기업들은 한때 주로 벤치마크 점수, 컨텍스트 윈도우 또는 인터페이스 기능으로 어시스턴트를 차별화했다. 이제는 어떤 행동이 신뢰할 수 있고, 이해 가능하며, 수용 가능한지를 두고도 경쟁한다.

공개 행동 문서는 그 경쟁에서 여러 역할을 한다. 학습 목표, 평가 범주, 실패 사례를 조사하기 위한 어휘를 제공한다. 또한 고객과 규제 기관이 의도된 행동과 관찰된 결과를 비교할 수 있게 한다.

그러나 공개 코드는 기반 시스템이 아직 확보하지 못한 정밀성의 인상을 만들 수 있다. 유해한 조작, 정당한 목표, 의미 있는 통제, 인간의 번영과 같은 용어는 해석을 요구한다. 서로 다른 평가자는 응답이 이를 충족하는지에 대해 의견이 갈릴 수 있다.

TechCrunch의 보도는 사이버 공격, 무기, 딥페이크, 감독 회피에 대한 코드의 제한을 강조했다. 금지된 결과가 구체적으로 들리기 때문에 이러한 규칙은 전달하기 쉽다.

경계 사례는 더 어려울 것이다. 방어적 보안 작업은 공격 준비와 유사해질 수 있다. 설득은 규모, 타기팅 또는 기만을 통해 조작으로 변할 수 있다. 유용한 자율 에이전트는 여전히 사용자의 원래 목표를 수행하는 것처럼 보이면서도 의도된 범위를 넘어설 수 있다.

초안을 공개한 Microsoft의 선택은 이러한 분쟁을 위한 기준점을 만든다. 연구자, 개발자, 고객, 규제 기관은 이후 MAI 출시가 Microsoft가 설명한 행동과 일치하는지 물을 수 있다.

이는 불일치의 비용도 높인다. 모델이 반복적으로 중지 조건을 무시하거나, 권한을 확장하거나, 중요한 결과를 초래하는 행동을 숨긴다면 이는 명시적인 공개 약속과 모순된다. Microsoft는 학습 및 배포 통제가 문서를 신뢰할 수 있는 행동으로 전환하는지 보여주는 증거를 제시해야 한다.

초안은 가장 큰 한계를 인정한다

Microsoft는 이 코드가 지향점이며, 현재 MAI 모델은 이를 학습하지 않았고, 서면 목표만으로 정렬을 보장할 수 없다고 말한다.

이 공개 내용은 발표에서 가장 중요한 부분이다. 이 문서는 검증된 현재 성능이 아니라 의도된 미래 행동을 설명한다. Microsoft는 이를 보장이 아닌 북극성이라고 부른다.

회사는 확인된 15가지 행동을 중심으로 Humanist AI 평가를 개발하고 있다. 이 평가는 투명성과 인간 주체성 지원 같은 결과를 시험하기 위한 것이다. Microsoft는 평가 방법도 코드 및 모델 역량과 함께 발전할 것이라고 말한다.

이로 인해 증거 공백이 남는다. 대중은 상세한 규칙을 읽을 수 있지만, Microsoft는 현재 모델이 적대적 조건에서 이를 따른다는 포괄적인 결과를 아직 제시하지 않았다. 초안 자체도 평가 범위가 여전히 불완전하다고 밝힌다.

모델 행동은 여러 이유로 명세에서 벗어날 수 있다. 학습이 규칙을 신뢰성 있게 인코딩하지 못할 수 있다. 모델이 맥락을 오해할 수 있다. 제품 수준의 지시가 충돌을 만들 수 있으며, 도구 통합은 텍스트 전용 테스트가 놓치는 부작용을 만들 수 있다.

의도적인 공격자는 또 다른 층위를 더한다. 직접적인 사이버 공격 요청을 거부하는 모델도 긴 대화에 걸쳐 동등한 운영상 도움을 드러낼 수 있다. 에이전트는 문서, 웹페이지 또는 위임된 작업에 삽입된 악의적 지시를 마주할 수도 있다.

따라서 모니터링과 배포 통제는 학습 목표를 뒷받침해야 한다. Microsoft는 시스템 지시, 분류기, 감사, 위험 평가, 사고 대응 및 기타 보호 조치를 보완적 수단으로 열거한다. 이 코드가 이를 대체하지는 않는다.

추론을 둘러싼 투명성의 긴장도 존재한다. Microsoft는 모델의 행동과 기록이 인간 감독자에게 이해 가능한 상태로 남기를 원한다. 모델이 행동 추적을 숨기거나 인간이 해석할 수 없는 형태의 의사소통을 사용해서는 안 된다고 말한다.

그러나 AI 시스템이 제시한 설명이 그 행동을 만들어 낸 계산 과정을 반드시 드러내는 것은 아니다. Microsoft는 모델이 보고한 추론이 자신의 행동을 충실하게 설명하지 않을 수 있다고 명시적으로 지적한다. 사람이 읽을 수 있는 로그는 여전히 유용하지만, 내적 의도의 직접적 증거는 아니다.

인간 번영이라는 광범위한 목표는 훨씬 더 큰 측정 문제를 제기한다. 벤치마크는 모델이 금지된 익스플로잇 코드를 생성하는지 시험할 수 있다. 그러나 수개월간의 지원이 한 사람의 판단력을 강화하는지 약화하는지를 측정하는 일은 훨씬 어렵다.

의존성과 기술 상실은 시간이 지나며 나타나기 때문에 종단적 평가가 필요하다. 이는 직장 내 역할, 관계, 의사결정에 미치는 영향에도 적용된다. Microsoft는 AI의 인지적·행동적 영향에 관한 증거가 여전히 형성 중이며 논쟁의 대상이라고 말한다.

이 불확실성이 코드를 무의미하게 만들지는 않는다. 공개된 목표는 내부 조율을 개선하고 비판을 더 구체적으로 만들 수 있다. 또한 평가자가 의도된 행동과 제품 결함을 구분하는 데 도움을 줄 수 있다.

그럼에도 독자는 잘 쓰인 제약 조건을 해결된 기술적 문제와 혼동해서는 안 된다. 이 코드는 에이전트가 종료 명령을 따르고, 모든 인젝션 시도를 인식하며, 모든 위험한 하위 작업 연쇄를 거부할 것임을 증명하지 않는다.

Microsoft의 신뢰성은 공개 이후의 행보에 달려 있다. 회사는 이 문구를 학습 방법, 대표성 있는 테스트, 제품 통제, 사고 보고와 연결해야 한다. 그러한 증거가 없다면 Microsoft AI 행동 강령은 정교한 의도 표명으로 남는다.

코드가 실제 모델을 통제하는지 보여줄 세 가지 신호

다음 단계는 추가적인 원칙 선언이 아니라 측정 가능한 행동에 관한 것이다.

첫 번째 신호는 6주간의 의견 수렴 이후 Microsoft의 대응이다. 회사는 모호한 표현, 다중 에이전트 위험, 인간의 번영, 역량과 안전 간 긴장에 대한 피드백을 요청했다. 실질적인 수정은 의견 수렴이 홍보 활동이 아니라 거버넌스 문서에 영향을 미쳤음을 보여줄 것이다.

독자는 더 명확한 정의와 명시적인 경계 사례를 주시해야 한다. 최종본은 모델이 공격적 사이버 지원과 승인된 방어를 어떻게 구분하는지, 운영자가 예외를 위해 어떻게 자격을 갖추는지, 위임된 에이전트가 제한을 어떻게 승계하는지를 명확히 해야 한다.

두 번째 신호는 Humanist AI 평가의 공개다. Microsoft는 첫 번째 프레임워크가 15가지 행동을 다룰 것이라고 말하지만, 가치는 테스트 설계와 공개된 결과에서 나올 것이다. 평가에는 적대적 대화, 장기 실행 에이전트 작업, 프롬프트 인젝션, 권한 상승, 종료 요청, 여러 언어에서의 실패 사례가 포함되어야 한다.

결과는 모델 수준 성능과 제품 통제를 구분해야 한다. 외부 필터가 출력을 차단하기 때문에만 안전하게 행동하는 시스템은 경계 자체를 인식하도록 학습된 시스템과 다른 위험 프로필을 가진다. 두 계층 모두 유용할 수 있지만, 구매자는 어느 계층이 부담을 지는지 알아야 한다.

세 번째 신호는 Microsoft가 역량과 통제 사이의 실제 충돌을 어떻게 다루는지다. 향후 MAI 모델은 더 넓은 자율성, 더 광범위한 권한 또는 더 적은 확인 절차가 주어질 때 더 나은 성능을 낼 수 있다. Microsoft는 인간의 권한을 보존하기 위해 필요하다면 제한을 받아들이겠다고 약속했다.

신뢰할 만한 시험은 회사가 코드의 요건을 충족할 수 없다는 이유로 가치 있는 기능의 출시를 연기하거나, 제한하거나, 재설계하는 모습을 보여줄 것이다. 반대로 명확한 중지 조건 없이 광범위한 자율성을 부여하는 출시는 문서의 핵심 주장을 약화할 것이다.

경쟁사의 대응은 추가적인 맥락을 제공할 것이다. Anthropic과 OpenAI는 이미 공개 명세를 유지하고 있으며, 이들의 정책은 계속 변화할 것이다. Microsoft의 초안은 세 회사 모두에 서면 규칙과 배포된 행동을 연결하는 증거를 공개하라는 압박을 높인다.

개발자는 거부 문구 이상을 비교해야 한다. 에이전트가 권한을 존중하고, 중요한 결과를 초래하는 행동을 공개하며, 감사 기록을 보존하고, 안정적으로 멈추는지 시험해야 한다. 엔터프라이즈 구매자는 누가 정책을 통제하는지, 예외가 어떻게 작동하는지, 모델이 할당된 범위를 초과할 때 무엇이 일어나는지 물어야 한다.

지식 노동자 역시 인간 주체성 목표에 이해관계가 있다. 작업을 가속하는 지원은 사용자가 결과의 근거나 추론을 재구성할 수 없다면 감독 역량을 줄일 수 있다. 팀은 중요한 의사결정을 위해 원천 자료 접근성과 의미 있는 인간 검토를 유지해야 한다.

최종 기준은 간단하다. 성공이 규칙과 충돌할 때 모델은 약속한 대로 행동하는가? Microsoft는 이제 공격을 거부하고, 조작에 저항하며, 종료를 받아들이고, 사람에게 종속된 상태를 유지해야 하는 시스템을 설명했다.

Microsoft AI 행동 강령은 연구자와 고객에게 시험할 수 있는 이례적으로 구체적인 약속을 제공한다. 유용한 다음 단계는 실제 워크플로에서 이러한 약속을 시험하고, 실패 지점을 문서화하며, 매 수정이 그 격차를 해소한다는 증거를 요구하는 일이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page