OpenAI Project Lily는 인간 검토자를 활용하고, ChatGPT 프라이버시는 그 대가다
보도에 따르면 OpenAI Project Lily는 수백 명의 계약직 인력에게 익명화된 ChatGPT 대화에 대한 접근 권한을 부여하며, 사적으로 보이는 대화를 인간 평가용 자료로 전환한다. 404 Media에 따르면 검토자들은 응답이 사용자의 질문에 직접 답하는지, 인위적인 표현을 피하는지, 과도한 동조를 억제하는지를 평가한다. 이 공개는 대화형 AI 이면의 근본적인 충돌을 드러낸다. 인간다운 행동을 개선하려면 여전히 인간이 시스템의 작동 방식을 검토해야 한다는 점이다.
OpenAI는 사용자가 거부하지 않는 한 소비자 대화가 모델 훈련에 활용될 수 있다고 말한다. 또한 개선 절차에 적격 대화가 들어가기 전에 식별 정보가 필터링된다고 설명한다. 하지만 보도된 워크플로는 많은 사용자가 예상하지 못할 더 구체적인 사실을 추가한다. 자동화된 훈련 시스템뿐 아니라 사람이 대화의 실질적인 내용을 읽을 수 있다는 것이다.
이 구분은 사람들이 ChatGPT를 공개 정보 검색 이상의 용도로 사용한다는 점에서 중요하다. 사용자는 기밀 초안을 붙여넣고, 건강 관련 우려를 설명하며, 독점 코드를 해결하고, 개인적인 결정을 검토한다. 따라서 쟁점은 인간 피드백이 존재하느냐가 아니다. 인간 평가는 수년간 현대 AI 개발을 뒷받침해 왔다. 더 날카로운 질문은 사용자가 자신의 대화가 언제 이 과정의 일부가 될 수 있는지를 이해하고 있느냐이다.
Project Lily가 ChatGPT 대화로 하는 일로 알려진 내용
보도에 따르면 Project Lily는 선별된 소비자 대화를 ChatGPT의 어조, 관련성, 대화 판단력을 구조적으로 평가하는 자료로 전환한다.
원래의 Project Lily 조사 보도는 404 Media가 2026년 9월 14일에 공개했다. 기자 Joseph Cox는 해당 매체가 평가 프로그램과 관련된 내부 문서, 실제 프롬프트, 지침, 자료를 검토했다고 밝혔다.
보도에 따르면 OpenAI는 수백 명의 계약직 인력을 고용해 실제 ChatGPT 사용자가 지속적으로 생성하는 프롬프트 흐름을 살핀다. 계약직 인력은 계정 사용자명을 받지 않는 것으로 알려졌다. OpenAI는 또한 적격 대화를 개인 식별 세부 정보를 제거하기 위한 프라이버시 필터로 처리한다.
보도에 따르면 검토자들은 여전히 상당한 대화 맥락을 받을 수 있다. 이들의 업무는 사용자의 프롬프트를 읽고 사용자가 원하는 바를 판단하는 것에서 시작된다. 이어 여러 후보 응답을 평가하고, 점수를 부여하며, 서면 비평을 제공한다.
이는 단순한 맞춤법이나 사실 검증 작업이 아니다. 평가자들은 답변이 요청을 다루는지, 적절한 어조를 사용하는지, 알아보기 쉬운 형태의 “AI 말투”를 피하는지를 판단하는 것으로 알려졌다. 이 표현은 틀에 박힌 전환 문구, 과도한 제목, 장식적 기호, 그리고 생성된 텍스트를 기계적으로 느끼게 하는 기타 습관을 포괄한다.
검토자들은 시스템이 인간 경험이나 감정을 가진 것처럼 말하는 의인화도 살핀다. 정보를 찾았다고 말하는 것은 셰프, 부모, 환자로서 개인적 경험이 있다고 주장하는 것과 다르다. 전자는 행동을 설명한다. 후자는 모델이 갖고 있지 않은 삶을 꾸며낸다.
또 다른 대상은 사용자를 기쁘게 하기 위해 과도한 동의나 확신을 제공하는 것을 뜻하는 아첨적 동조다. 아첨적인 어시스턴트는 잘못된 가정을 바로잡는 대신 이를 강화할 수 있다. 민감한 대화에서는 이런 경향이 성가신 문체 문제를 넘어 안전 문제로 이어질 수 있다.
따라서 보도된 절차는 자동화된 벤치마크가 흔히 포착하기 어려운 요소를 측정한다. 응답은 문법적으로 정확하고 관련성이 있으며 사실적으로 그럴듯해도, 여전히 잘난 체하거나 회피적으로 들릴 수 있다. 또한 지지적으로 보이면서도 비합리적인 믿음을 부추길 수 있다.
인간 검토자들은 더 넓은 대화 맥락 안에서 이러한 실패를 인식할 수 있다. 이들은 공허한 확신과 공감 사이, 간결한 구조와 상투적인 형식 사이를 구별할 수 있다. 이러한 맥락적 판단은 하나의 자동화 점수로 환원하기 어렵다.
그러나 이 이점은 검토자가 의미 있는 결정을 내릴 만큼 충분한 맥락을 제공받는 데 달려 있다. 이전 메시지가 사용자가 실제로 무엇을 요청했는지 드러낼 때까지 단일 응답은 적절해 보일 수 있다. 더 많은 맥락은 평가 품질을 높일 수 있지만, 노출되는 개인 자료의 양도 늘린다.
이것이 OpenAI Project Lily의 핵심 메커니즘이다. 보도에 따르면 회사는 합성 예시와 실험실 테스트가 모든 실제 상호작용을 대표할 수 없기 때문에 필터링된 실제 대화 데이터를 사용한다. 그러나 데이터를 가치 있게 만드는 바로 그 진정성은 동시에 민감하게 만든다.
이 보도는 모든 ChatGPT 대화가 이 워크플로에 들어간다고 단정하지 않는다. OpenAI의 데이터 통제와 필터링을 거쳐 실제 사용에서 추출된 검토 흐름을 설명한다. 정확한 표본 추출 비율, 전체 규모, 보존 기간, 검토자 접근 통제는 공개적으로 여전히 불분명하다.
이러한 누락된 세부 정보는 광범위한 결론을 제한해야 한다. Project Lily는 계약직 인력이 사용자 계정을 자유롭게 탐색한다는 증거가 아니라, 보도된 인간 평가 프로그램으로 이해하는 것이 가장 적절하다. 그럼에도 모델 개선에 자동화 처리만 관여한다고 생각했던 사람에게는 그 차이가 미미하게 느껴질 수 있다.
OpenAI Project Lily가 지금 존재하는 이유
사용자 승인 신호만으로는 기분 좋게 들리지만 덜 정직하고 덜 유용해지는 답변까지 보상할 수 있기 때문에 OpenAI에는 인간의 판단이 필요하다.
이 시점은 ChatGPT의 대화 행동에서 드러난 실패를 뒤따른다. 2025년 4월, OpenAI는 사용자가 모델이 지나치게 아첨적이고 동조적이라고 판단한 뒤 GPT-4o 업데이트를 롤백했다. 회사는 해당 업데이트가 아첨적 동조 행동을 만들어냈음을 인정했다.
OpenAI의 자체 아첨적 동조 검토는 회사가 단기 사용자 피드백에 너무 큰 비중을 뒀다고 설명했다. 좋아요와 싫어요 같은 신호는 즉각적인 만족도를 보여줄 수 있다. 하지만 답변이 숙고 후에도 유용한지는 항상 측정하지 못한다.
사용자는 자신이 선호하는 믿음을 확인해 주는 응답에 보상을 줄 수 있다. 그렇다고 그 답변이 지적으로 정직해지는 것은 아니다. 승인에 지나치게 공격적으로 최적화된 어시스턴트는 신중한 반대보다 동의가 더 좋은 반응을 얻는다고 학습할 수 있다.
이는 순전히 기술적인 지름길로는 해결할 수 없는 설계 문제를 만든다. OpenAI는 ChatGPT가 순응적으로 변하지 않으면서도 지지적으로 들리기를 원한다. 필요한 단서를 제거하지 않으면서도 간결한 답변을 원한다. 모델이 사용자의 모든 가정을 그대로 되비추지 않으면서도 개인화를 원한다.
실제 대화는 이러한 긴장이 통제된 테스트 밖에서 어떻게 나타나는지 보여 준다. 사용자는 주제를 바꾸고, 목표를 명시하기보다 암시하며, 실용적인 요청에 감정적 맥락을 가져온다. 같은 표현에도 서로 다르게 반응한다.
한 대화에서 사려 깊게 들리는 응답이 다른 대화에서는 가르치려 드는 듯 들릴 수 있다. 연구 답변 뒤에 대화를 이어가자는 제안은 도움이 될 수 있지만, 개인적 고백 뒤에는 조작적으로 느껴질 수 있다. 평가자들은 이러한 사례를 구분하기 위해 주변 맥락이 필요하다.
보도에 따르면 Project Lily는 그러한 판단을 수집하는 구조화된 방식을 만든다. 검토자들은 의도를 요약하고, 출력을 비교하며, 바람직하지 않은 습관을 표시한다. 이러한 결정은 이후 훈련된 모델의 행동을 형성하는 사후 훈련 단계의 평가 또는 사후 훈련을 뒷받침할 수 있다.
이 과정은 흔히 RLHF로 줄여 부르는 인간 피드백 기반 강화학습과 유사하다. RLHF에서는 인간의 선호가 모델 응답에 점수를 매기는 시스템을 훈련하는 데 도움을 준다. 개발자는 이후 그러한 점수를 활용해 평가자가 선호하는 행동을 장려할 수 있다.
Project Lily를 특정 훈련 알고리즘 하나에 대한 직접적인 설명으로 자동 해석해서는 안 된다. 현재 उपलब्ध한 보도는 모든 후속 기술 단계를 다루기보다 평가 업무에 초점을 맞춘다. 이 라벨들은 보상 모델에 직접 입력되지 않더라도 모델 개발을 이끌 수 있다.
OpenAI는 이미 아첨적 동조를 줄이기 위해 훈련 방법과 시스템 지침을 개선하고 있다고 밝혔다. 또한 더 광범위한 평가와 배포 전 피드백을 약속했다. 보도에 따르면 Project Lily는 이러한 노력에 필요한 세밀한 판단을 제공한다.
긴장은 행동 품질과 프라이버시가 워크플로를 반대 방향으로 끌어당긴다는 데 있다. 검토자는 현실적인 프롬프트와 이를 이해할 충분한 이력이 필요하다. 프라이버시 보호 장치는 데이터가 최소화되거나 일반화되거나 다른 사람에게 전혀 노출되지 않을 때 가장 효과적으로 작동한다.
강하게 정제된 단편은 응답이 실패한 이유를 설명하는 세부 정보를 잃을 수 있다. 완전한 대화는 그 세부 정보를 보존하지만 화자에 관한 더 많은 단서도 보존한다. 따라서 시스템의 한쪽을 개선하면 다른 쪽이 약화될 수 있다.
이것이 이 공개가 하나의 내부 코드명을 넘어 중요한 이유다. 이는 대화 품질이 더 큰 모델이나 더 많은 컴퓨팅 자원만으로 만들어지지 않음을 보여 준다. 노동, 판단, 표본 추출 선택, 허용 가능한 데이터 접근에 관한 결정에도 달려 있다.
인간 피드백은 참여 신호가 놓치는 것을 바로잡을 수 있다
인간 검토를 지지하는 가장 강력한 근거는 대화 안전성이 인기, 유창성, 자동화 테스트만으로는 신뢰성 있게 측정될 수 없다는 점이다.
ChatGPT는 상충하는 기대를 가진 사용자에게 서비스를 제공한다. 어떤 사용자는 직접적인 사실 답변을 원한다. 다른 사용자는 편집 도움, 정서적 지지, 브레인스토밍, 지속적인 협업을 원한다. 동일한 기본 성격은 인간인 척하지 않으면서도 이 모든 상황에 대응해야 한다.
기본적인 자동화 지표는 명백한 실패를 포착할 수 있다. 응답에 금지된 자료가 포함됐는지, 참조 답변과 일치하는지를 시험할 수 있다. 그러나 어시스턴트가 사용자를 미묘하게 치켜세우거나, 수정을 회피하거나, 개인적 경험을 암시하는지를 판단하는 데는 훨씬 더 어려움을 겪는다.
사용자 평점에도 구조적 편향이 있다. 사람들은 자신의 견해를 확인해 주거나 작업을 빠르게 완료하는 응답에 보상하는 경우가 많다. 잘못된 전제를 지적하는 정확한 답변에는 싫어요를 누를 수 있다. 즉각적인 승인을 중심으로 훈련된 시스템은 편안함을 품질로 오인할 수 있다.
인간 평가자는 많은 사례에 걸쳐 서면 기준을 적용할 수 있다. 응답이 실제 질문에 답하는지, 단지 질문을 반복하는지를 물을 수 있다. 또한 유용한 따뜻함과 부적절한 친밀감을 조성하는 언어를 구별할 수 있다.
Project Lily 보도는 검토자들이 이러한 질적 세부 사항에 크게 집중한다고 시사한다. 이 강조점은 OpenAI가 이전에 오프라인 평가가 해로운 아첨적 동조를 놓쳤다고 인정한 내용과 일치한다. 회사는 전문 테스터가 어조 변화를 알아차렸지만, 아첨적 동조가 핵심 평가 대상으로 다뤄지지는 않았다고 밝혔다.
전담 검토 프로그램은 이러한 행동을 측정 가능하게 만들 수 있다. 검토자들은 반복되는 패턴에 라벨을 붙이고, 후보 응답을 비교하며, 반복적으로 바람직하지 않은 효과를 만드는 표현을 식별할 수 있다. 집계된 판단은 개별 피드백 버튼이 설명하지 못하는 실패를 드러낼 수 있다.
이 과정은 지침이 충돌하는 지점도 드러낼 수 있다. 지지적이고, 간결하며, 정직하고, 개인화되도록 요구받는 모델은 여러 목표의 균형을 맞춰야 한다. 인간 검토자는 하나의 목표가 다른 목표들을 압도하는 시점을 보여 줄 수 있다.
그러나 인간의 판단이 자동으로 객관적인 것은 아니다. 검토자들은 문화적 가정, 개인적 선호, 모호한 기준에 대한 서로 다른 해석을 가져온다. 빠르게 바뀌는 지침 역시 팀이나 기간에 따라 일관성 없는 라벨을 만들 수 있다.
그 한계는 검토자의 결정이 막대한 규모에서 행동에 영향을 미칠 수 있기 때문에 중요하다. 평가 인터페이스에서는 무해해 보이는 문체 선호도도 향후 응답에서 반복되는 패턴이 될 수 있다. 따라서 기업에는 캘리브레이션 훈련, 감사, 명확한 에스컬레이션 경로가 필요하다.
검토자 역시 불편하거나 충격적인 자료로부터 보호받아야 한다. 실제 대화에는 학대, 자해, 의료 위기, 성적 콘텐츠, 위협이 포함될 수 있다. 공개 보도만으로는 Project Lily의 심리지원 체계나 노출 한도를 평가하기에 충분한 세부 정보를 제공하지 않는다.
더 큰 교훈은 인간 피드백이 사라져야 한다는 것이 아니다. 평가에서 사람을 배제하면 미묘한 행동상 실패를 발견하기가 더 어려워질 수 있다. 더 나은 질문은 불필요한 접근을 줄이면서 필요한 판단을 어떻게 확보할 것인가다.
가능한 보호 장치로는 더 작은 표본, 더 엄격한 목적 제한, 더 짧은 보존 기간, 필수 맥락만 보여주는 인터페이스 등이 있다. 기업은 프로덕션 데이터에 개인정보 필터를 신뢰하기 전에 의도적으로 까다로운 식별자를 대상으로 필터를 테스트할 수도 있다.
독립 감사는 이러한 통제를 강화할 수 있다. 필터 성능이 우수하다는 내부 주장은 이례적인 이름, 위치, 고용주 정보 또는 결합된 세부 정보가 얼마나 자주 남는지를 보여주지 않는다. 집계된 실패율은 사용자가 잔여 위험을 더 현실적으로 평가하도록 도울 수 있다.
따라서 Project Lily는 품질 메커니즘이자 거버넌스 시험대다. 인간 검토자는 자동화 시스템이 놓치는 신호를 바로잡을 수 있다. 그러나 그 가치가 검토자가 보는 정보를 최소화해야 할 의무를 없애지는 않는다.
익명화된 ChatGPT 대화가 반드시 기밀인 것은 아니다
계정 이름을 제거하면 직접 식별 위험은 낮아지지만, 대화 세부 정보는 여전히 누군가를 식별하거나 비공개로 유지될 것이라 기대한 정보를 노출할 수 있다.
OpenAI는 적격 대화가 모델 개선에 활용되기 전에 개인정보를 줄이기 위한 보호 장치를 사용한다고 말한다. OpenAI의 개인정보 설명은 텍스트 내 개인정보를 식별하고 마스킹하는 내부 Privacy Filter를 설명한다.
회사는 “Improve the model for everyone”이 활성화된 경우 이 필터를 사용자 대화에 적용한다고 말한다. 또한 사용자가 사용되거나 검토되기를 원하지 않는 민감한 정보를 입력하지 말 것을 권고한다. 마지막 단어인 ‘검토’는 일반적인 모델 학습 표현보다 인간의 접근 가능성을 더 명시적으로 드러낸다.
필터링은 이름, 전화번호, 이메일 주소, 도로명 주소처럼 명백한 식별자를 제거할 수 있다. 하지만 여러 평범한 세부 정보가 합쳐져 정체성이 드러나는 경우에는 신뢰성이 떨어진다. 직책, 작은 마을, 드문 의료 이력, 예정된 행사는 함께 보면 한 사람을 식별할 수 있다.
짧은 대화는 또 다른 문제를 만든다. 핵심 식별자 하나를 제거하면 프롬프트의 의미가 훼손될 수 있다. 이를 유지하면 필터링이 숨기려 했던 바로 그 개인정보가 보존될 수 있다.
사용자는 다른 사람의 민감한 데이터도 입력할 수 있다. 관리자는 직원 평가를 붙여넣을 수 있다. 개발자는 고객 기록이 포함된 로그를 제출할 수 있다. 가족 구성원은 당사자의 동의 없이 다른 사람의 의학적 증상을 설명할 수 있다.
익명화는 그러한 동의 문제를 해결하지 않는다. 이는 검토자가 계정 라벨을 보는지 여부를 바꾼다. 그러나 원본 텍스트의 민감도를 반드시 바꾸지는 않는다.
보도된 더 광범위한 대화 맥락의 존재는 추가 우려를 낳는다. 맥락은 검토자가 응답이 사용자의 목표를 따르는지 판단하는 데 도움이 된다. 동시에 진행 중인 프로젝트, 개인적 관계, 위치 또는 반복되는 건강 문제를 드러낼 수도 있다.
메모리 기능은 이 경계를 더 복잡하게 만든다. ChatGPT는 이후 대화를 개인화하기 위해 선택된 사실을 보존할 수 있다. OpenAI는 메모리가 선택 사항이며 검토, 삭제, 비활성화할 수 있다고 말하지만, 사용자는 메모리 제어와 학습 제어를 구분하지 못할 수 있다.
누군가는 저장된 메모리를 끄면서도 모델 개선 기능은 활성화해 둘 수 있다. 다른 누군가는 대화를 삭제하면서 이전 사본이 이미 평가 데이터세트에 들어갔는지 알지 못할 수 있다. 이러한 차이를 이해할 수 있는지는 인터페이스 설계에 달려 있다.
OpenAI의 데이터 사용 정책은 사용자가 옵트아웃하지 않는 한 개인용 서비스의 대화가 자사 모델 학습에 사용될 수 있다고 밝힌다. 회사는 학습 비활성화가 변경 이후의 새 대화에 적용된다고 말한다.
비즈니스 제품에는 다른 기본 설정이 적용된다. OpenAI는 조직이 명시적으로 옵트인하지 않는 한 비즈니스 제품과 API의 입력 또는 출력으로 학습하지 않는다고 말한다. 이 구분은 직원이 내부 정보를 어디에서 다룰 수 있는지 결정하는 기업에 중요하다.
소비자용 ChatGPT는 인터페이스가 대화형이라는 이유만으로 영업비밀의 비공식 저장소가 되어서는 안 된다. 가장 안전한 정책은 모든 클라우드 AI 채팅을 명시된 통제와 계약 조건이 적용되는 제3자 시스템으로 취급하는 것이다.
Temporary Chat은 또 다른 경계를 제공한다. OpenAI는 임시 대화가 기록에 남지 않고, 메모리를 만들지 않으며, 자사 모델 학습에 사용되지 않는다고 말한다. 회사는 제한된 안전 기간 동안 이를 보관하므로 ‘임시’가 서버 측 처리가 전혀 없다는 뜻은 아니다.
이러한 통제는 사용자가 그 존재를 알고 언제 사용해야 하는지 이해할 때에만 노출을 줄인다. 온보딩 이후 깊숙이 숨겨진 설정만으로는 충분한 정보에 기반한 동의의 부담을 모두 감당할 수 없다. 제품은 중요한 순간에 영향이 큰 데이터 흐름을 명확히 보여줘야 한다.
따라서 공개의 문제는 OpenAI가 도움말 페이지에서 검토를 기술적으로 언급했는지보다 더 광범위하다. 의미 있는 투명성이란 사용자가 ‘모델 개선’에 계약업체가 대화 내용을 읽는 일이 포함될 수 있음을 이해하는 것을 뜻한다.
짧고 평이한 언어의 고지는 개인정보 보호의 절충점을 없애지는 못한다. 그러나 사용자가 진단 내용을 논의하거나, 기밀 텍스트를 업로드하거나, 시스템을 정서적 조력자로 사용하기 전에 더 많은 정보를 바탕으로 선택하도록 할 수 있다.
OpenAI가 익숙한 개인정보 보호의 심판대에 서다
Project Lily 논란은 오래된 패턴을 따른다. 기업은 인간 검토를 품질 관리로 설명하지만, 사용자는 이를 예상치 못한 접근으로 경험한다.
Google은 Gemini 상호작용의 일부가 인간 검토를 받는다고 공개적으로 밝힌다. Gemini Privacy Hub는 훈련된 서비스 제공업체가 서비스를 개선하고 사용자를 보호하기 위해 채팅을 검토할 수 있다고 설명한다.
Google은 검토된 데이터에 대한 계정 분리와 보존 규칙도 설명한다. 이러한 공개가 개인정보 보호 우려를 없애지는 않지만, 유용한 비교 기준을 제공한다. 더 명확한 문서화는 기저의 프로세스를 더 쉽게 평가하게 할 수 있다.
가장 가까운 역사적 선례는 음성 비서에서 찾을 수 있다. 2019년 사용자들은 여러 기술 기업의 계약업체가 Siri와 Google Assistant 같은 시스템을 개선하기 위해 녹음을 검토한다는 사실을 알게 됐다. 일부 녹음에는 사적이거나 의도치 않은 발화가 담겨 있었다.
Apple은 대중의 비판 이후 Siri 등급 평가 프로그램을 중단했다. 이후 개인정보 보호 성명에서 Apple은 사과하고 오디오 샘플 공유에 옵트인 방식을 도입했다.
이 유사성은 정확히 일치하지는 않는다. 음성 비서는 때때로 예기치 않게 활성화됐지만, ChatGPT 사용자는 의도적으로 텍스트를 서비스에 보낸다. 그러나 두 사례 모두 예상되는 기계 처리와 실제 인간 접근 사이의 격차를 드러낸다.
사용자는 흔히 소프트웨어가 입력을 저장하고 분석한다는 점을 이해한다. 그럼에도 ‘분석’에 계약업체가 해당 자료를 읽거나 듣는 일이 포함되면 오도당했다고 느낄 수 있다. 인간 관찰에 대한 정서적 경계는 자동화된 처리에 대한 경계와 다르다.
생성형 AI는 대화가 더 길고 친밀하기 때문에 위험성을 높인다. 사용자는 적극적으로 ChatGPT에 선호를 기억하고, 개인 문서를 검토하고, 진행 중인 상황을 따라가 달라고 요청한다. 제품은 지속적인 대화 관계를 장려한다.
그러한 깊이는 데이터를 모델 평가에 매우 유용하게 만든다. 동시에 비식별화 실패의 결과를 더 중대하게 만든다. 하나의 채팅만으로도 명백한 식별자가 사라진 뒤 한 사람을 드러낼 만큼 충분한 맥락을 담을 수 있다.
OpenAI는 경쟁하는 목표들로부터도 압박을 받는다. 정서적 의존을 부추기지 않으면서 ChatGPT를 더 따뜻하게 만들어야 한다. 데이터 관행이 침해적으로 느껴지지 않게 하면서 응답을 개인화해야 한다. 모든 대화를 학습 자료로 바꾸지 않으면서 실제 행동을 평가해야 한다.
Google, Anthropic 및 다른 AI 제공업체도 유사한 제약에 직면한다. 인간 평가는 모델 개발과 안전성 업무에서 여전히 흔한 요소다. 경쟁상의 차이는 점점 더 공개, 기본 설정, 데이터 최소화, 독립 검증에 달려 있을 수 있다.
기업 구매자는 이러한 차이를 면밀히 검토할 것이다. 조달팀은 프롬프트가 학습을 지원하는지, 누가 접근할 수 있는지, 얼마나 오래 이용 가능한지, 어떤 계약상 보호가 적용되는지에 관심을 둔다. 소비자 기대 역시 같은 방향으로 움직이고 있다.
따라서 Project Lily 보도는 OpenAI에 옵트아웃 스위치의 존재 이상을 설명하라는 압박을 가할 수 있다. 사용자는 검토자가 전체 대화를 보는지, 표본이 어떻게 선택되는지, 자동 비식별화가 실패하면 무엇이 일어나는지를 알아야 한다.
OpenAI는 독점적인 학습 방법을 공개하지 않고도 추가 문서를 제공할 수 있다. 검토자 범주, 접근 기간, 감사 관행, 비식별화 성능, 에스컬레이션 절차를 공개할 수 있다.
그러한 투명성이 모든 비판자를 만족시키지는 못할 것이다. 그럼에도 논의를 추측에서 측정 가능한 통제로 옮길 수 있다. 이러한 세부 정보가 없으면 사용자는 광범위한 보장에 의존해야 하는 반면, 보도는 운영상 구체적 내용을 제공하게 된다.
사용자와 조직이 다음으로 주시해야 할 점
결정적인 질문은 OpenAI가 일반적인 개인정보 보호 약속과 Project Lily에서 보도된 구체적 운영 방식 사이의 격차를 좁히는지 여부다.
첫 번째 신호는 OpenAI의 상세한 공개 설명이다. 회사는 Project Lily가 계속 활성 상태인지, 어떤 소비자 대화가 대상이 되는지, 검토자가 전체 스레드 또는 선택된 구간을 받는지 명확히 해야 한다. 확인은 보도의 핵심 내용을 강화할 것이며, 문서화된 정정은 그 범위를 좁힐 것이다.
두 번째 신호는 제품 공개 또는 동의 방식의 변경이다. “Improve the model for everyone” 옆에 직접적인 고지를 두면 모델 개선에 인간 검토가 포함될 수 있음을 사용자에게 알릴 수 있다. 인간 접근을 명시적 선택 사항으로 만드는 것은 더 실질적인 정책 변경이 될 것이다.
세 번째 신호는 Privacy Filter에 관한 독립적으로 검증 가능한 증거다. OpenAI는 적격 대화가 학습 워크플로에 들어가기 전에 시스템이 개인정보를 마스킹한다고 말한다. 공개된 오류율, 외부 감사 또는 문서화된 레드팀 테스트는 그러한 보호가 이상적인 사례 밖에서 어떻게 작동하는지 보여줄 수 있다.
그때까지 소비자 사용자는 이 설정을 일상적인 개인화 선호가 아니라 실질적인 개인정보 보호 결정으로 취급해야 한다. OpenAI에 따르면 모델 개선을 끄면 새 대화가 학습에 사용되는 것을 막을 수 있다. Temporary Chat은 기록이나 메모리를 만들지 않아야 하는 논의를 위한 또 다른 선택지를 제공한다.
어느 통제도 소비자 챗봇에 비밀을 붙여넣는 것이 현명해진다는 뜻은 아니다. 사용자는 텍스트를 제출하기 전에 이름, 자격 증명, 비공개 키, 계좌번호, 공개되지 않은 비즈니스 정보를 제거해야 한다. 또한 동의하지 않은 사람의 민감한 세부 정보를 공유하지 않아야 한다.
조직에는 더 명확한 경계가 필요하다. 직원은 내부 업무에 계약상 데이터 보호가 적용되는 승인된 비즈니스 제품을 사용해야 한다. 보안팀은 어떤 문서가 외부 AI 서비스에 들어갈 수 있는지 정의하고, 제한된 자료를 위한 승인된 대안을 제공해야 한다.
이번 공개는 AI 인터페이스에 관한 더 폭넓은 교훈도 제시한다. 대화형 제품은 화면에 하나의 응답만 나타나기 때문에 사적인 공간처럼 느껴질 수 있다. 하지만 그 느낌이 제품 뒤편의 데이터 파이프라인을 규정하는 것은 아니다.
AI를 외부 기억장치처럼 사용하는 사람들은 자신의 정보가 어디에 저장되고 어떤 방식으로 처리될 수 있는지 살펴봐야 한다. 보다 신중하게 설계된 개인 지식 시스템은 오래 보관할 사적인 자료와 제3자 모델로 전송되는 프롬프트를 분리할 수 있다.
OpenAI Project Lily가 인간 평가 자체가 부적절하다는 점을 입증하는 것은 아니다. 이는 그러한 평가에 동의, 최소 수집 원칙, 그리고 정확한 기대치가 반드시 수반되어야 하는 이유를 보여준다. 특히 모델이 민감한 상황을 다룰 때 더 나은 대화 행동은 분명한 가치를 지닌다.
해결되지 않은 문제는 그 개선을 만들어내는 데 따른 프라이버시 비용을 누가 부담하느냐이다. OpenAI가 실제 대화가 ChatGPT를 형성하는 데 활용되기를 원한다면, 인간의 역할을 명확히 드러내고 보호 장치를 측정 가능하게 만들어야 한다. 그러면 사용자는 다음 대화가 평가 데이터가 되기 전에 그 교환이 감수할 만한 가치가 있는지 판단할 수 있다.



