환각 탐지기 연구가 보편적 신호가 아닌 최소 기준을 확인했다
r/MachineLearning의 한 연구자는 첫 토큰이 생성되기 전, 사전 등록된 탐지기가 20개 모델 배포 중 18개에서 목표를 달성했다고 밝혔다. 그러나 보고된 결과가 보편적 환각 탐지기의 존재를 입증하는 것은 아니다. 오히려 모델 내부 기하학에 기반한 공통 성능 하한을 시사한다.
이 구분은 중요하다. 모든 거짓 답변을 식별하지 못하더라도 여러 모델에 걸쳐 전이되는 탐지기는 유용한 라우팅 신호가 될 수 있다. 다만 현재 증거는 미공개이거나 아직 독립적 검토를 거치지 않은 실험을 설명하는 소셜 게시물에서 나온 것이다.
게시물은 주목할 만한 반전도 전한다. 모델 자체의 신뢰도를 추가해도 기하학 단독 탐지기보다 배포 범위가 개선되지 않았다. 동일한 두 배포에서 실패했으며, 이는 이번 테스트에서 신뢰도와 기하학이 중복되는 정보를 포착했음을 시사한다.
이 발견은 익숙한 두 접근법에 압박을 가한다. 하나는 토큰 확률을 편리한 사실성 점수로 취급한다. 다른 하나는 단일 내부 특성이 아키텍처, 데이터셋, 환각 유형 전반에 걸쳐 일반화될 것이라고 기대한다. 보고된 실험은 어느 기대도 가장 강한 형태로는 뒷받침하지 않는다.
사전 등록된 테스트는 20개 배포 중 18개를 통과했다
핵심 결과는 조건부 성공이다. 하나의 기하학 기반 탐지기가 보편적이지는 않았지만, 사전 등록된 적용 범위 기준을 충족한 것으로 보고됐다.
원본 MachineLearning 게시물에 따르면, 연구자는 10개 언어 모델에서 두 가지 작업을 평가했다. 첫 번째 실행에서는 총 20개의 모델-작업 배포가 만들어졌다.
이 프로젝트는 네 가지 광범위한 계열에 속하는 모델 내부 신호 29개를 조사했다. 이 계열은 어텐션 패턴, 잔차 스트림의 움직임, 리드아웃 기하학, 신뢰도를 포괄했다. 이후 선택기는 평가 데이터가 존재하기 전에 수립된 규칙에 따라 각 모델별로 하나의 신호를 선택했다.
포워드 패스는 특정 입력에 대해 모델이 수행하는 한 번의 완전한 계산이다. 제안된 탐지기는 생성된 텍스트가 उपलब्ध해지기 전에 이 계산을 검사한다. 이는 완성된 답변을 문서와 대조하거나 여러 샘플 응답을 비교하는 시스템과 구별된다.
생성 전이라는 제약은 보고된 20개 중 18개 결과를 흥미롭게 만든다. 재현된다면 탐지기는 애플리케이션이 긴 답변을 생성하는 데 시간을 쓰기 전에 위험을 부여할 수 있다. 제품은 이후 검색을 요청하거나, 질의를 다른 모델로 라우팅하거나, 사람의 검토를 요구할 수 있다.
기하학 단독 탐지기는 사전 등록된 규칙에 따라 최소 17개 배포를 통과해야 했다. 게시물은 18개를 통과했다고 말한다. 이는 기하학에서 도출된 신호가 테스트된 조건 전반에서 광범위하지만 불완전한 적용 범위를 설정할 수 있다는 제한적인 주장을 뒷받침한다.
이 수치는 탐지기가 환각의 90%를 잡았다는 뜻이 아니다. 배포 범위와 탐지 정확도는 서로 다른 측정값이다. 18개 배포에서 임계값을 통과했다는 것은 해당 환경에서 방법이 정해진 기준을 충족했다는 의미다.
기저 임계값, 클래스 균형, 데이터셋 구성, 보정 과정, 배포별 불확실성은 모두 독자가 이 수치를 해석하는 방식에 영향을 미친다. 완전한 실험 자료 없이는 이 결과를 운영 환경의 오류율로 변환할 수 없다.
사전 등록은 결과를 본 뒤 가설을 수정할 기회를 제한함으로써 설계를 강화한다. 하지만 레이블을 검증하거나, 구현 오류를 제거하거나, 선택된 테스트가 실제 애플리케이션을 대표한다는 보장을 제공하지는 않는다.
게시물은 절차가 두 차례 사전 등록됐다고 밝힌다. 이 세부 사항은 연구자가 탐색적 결정과 확증적 테스트를 분리하려 했음을 시사한다. 두 등록 문서에 독립적으로 접근할 수 있다면 어떤 특성, 임계값, 제외 기준, 통계 검정이 고정됐는지 분명해질 것이다.
따라서 가장 책임 있는 해석은 제한적이다. 기하학 단독 접근법은 테스트된 배포 대부분에서 계획된 기준을 넘었다고 보고됐다. 남은 실패 사례는 이 주장의 경계를 규정하기 때문에 중요하다.
신뢰도가 적용 범위를 넓히지 못한 이유
가장 뚜렷한 반전은 신뢰도가 부진했다는 점이 아니라, 기하학에 더해지는 적용 범위를 전혀 제공하지 못했다는 점이다.
모델 신뢰도는 흔히 가능한 다음 토큰에 할당된 확률을 뜻한다. 높은 값은 모델이 다른 대안보다 하나의 연속을 강하게 선호한다는 의미다. 그렇다고 선호된 연속이 외부 현실과 일치한다는 것이 입증되는 것은 아니다.
실험은 기하학과 모델의 신뢰도를 결합한 것으로 알려졌다. 이 결합 탐지기 역시 20개 중 18개 배포를 통과했다. 동일한 두 배포를 놓쳤으며, 어떤 배포도 구제하지 못했다.
더 강한 주장에 대한 사전 등록 기준은 최소 19개 배포였다. 결합 방법은 이에 도달하지 못했다. 보고된 결정 규칙에 따르면, 신뢰도가 적용 범위를 넓혔다는 명제는 반증됐다.
이 결과가 신뢰도에 유용한 정보가 전혀 없다는 것을 보여주지는 않는다. 이 작업과 모델에서는 유용한 변동이 선택된 기하학적 신호와 겹쳤을 수 있음을 시사한다. 다른 데이터셋이나 보정 방법에서는 보완적인 정보가 드러날 수 있다.
여기서 기하학은 내부 표현들 사이의 측정 가능한 공간적 관계를 뜻한다. 이러한 표현은 모델이 프롬프트를 처리하면서 정보를 인코딩하는 벡터다. 이들의 노름, 각도, 방향, 레이어 간 이동은 답변의 정확성과 상관관계를 보일 수 있다.
신뢰도는 같은 기저 네트워크에서 나온다. 따라서 모델 출력 부근의 기하학적 측정값이 토큰 확률로 표현되는 정보 대부분을 이미 포착할 수 있다는 것은 그럴듯하다. 게시물의 보고된 ‘구제 0건’ 결과는 이 설명과 일치한다.
최근 연구 역시 기하학적 지표가 서로 대체 가능하지 않다고 경고한다. 2026년 기하학적 탐지 지표 연구는 정확성, 관련성, 일관성, 완전성, 신뢰도를 포함한 서로 다른 특성에 각기 다른 통계량이 반응한다는 사실을 발견했다.
이 연구는 도메인 변화에 대한 상당한 민감도도 보고했다. 올바른 역사 답변과 잘못된 역사 답변을 구분하는 신호가 수학에서는 다르게 작동할 수 있다. 저자들은 정규화를 도입하고 다중 도메인 평가에서 향상을 보고했으며, 이는 보정이 결과를 어떻게 형성할 수 있는지를 강조한다.
더 넓은 교훈은 ‘환각’이 여러 실패 메커니즘을 결합한다는 점이다. 모델은 흔한 오해를 일관되게 말할 수도 있고, 여러 답변 중 하나를 추측할 수도 있으며, 제공된 증거를 무시하거나 추론 오류를 낼 수도 있다. 이러한 실패가 하나의 내부 시그니처를 공유할 필요는 없다.
신뢰도는 특히 알려진 배포 분포에 맞춰 보정될 때 응답 보류 정책에 여전히 유용하다. 그러나 애플리케이션은 얻기 쉽다는 이유만으로 원시 신뢰도를 독립적인 사실성 증거로 취급해서는 안 된다.
이 구분은 제품 설계에 영향을 미친다. 신뢰도 임계값은 불확실성을 식별할 수 있는 반면, 기하학 점수는 관련된 불안정성을 식별할 수 있다. 상관된 두 신호를 결합하면 새로운 증거원을 추가하지 않은 채 중복성의 외관만 만들 수 있다.
진정으로 보완적인 계층은 다른 것을 검사해야 한다. 검색된 기록과 주장을 대조하거나, 논리적 일관성을 테스트하거나, 인용을 검증하거나, 도구 결과가 답변을 뒷받침하는지 살펴볼 수 있다. 이러한 검사는 내부 망설임이 아니라 증거를 다룬다.
MachineLearning 주장은 보편적 탐지에 도전한다
공통의 성능 하한은 운영상 가치가 있지만, 보편적 탐지기에는 작업, 모델, 오류 정의 전반에서 더 강한 증거가 필요하다.
보고된 실험은 야심 찬 질문에서 출발했다. 하나의 내부 신호 계열이 생성 전에 환각을 탐지할 만큼 폭넓게 작동할 수 있는가? 그 답은 하한에 대해서는 그렇고, 보편성에 대해서는 아니라는 것으로 보인다.
이는 의미론적 구분이 아니다. 보편적 탐지기는 유리한 작업 구조, 아키텍처별 보정, 좁은 오류 정의에 의존하지 않고 전이돼야 한다. 20개 배포 중 두 번의 실패만으로도 그 절대적 주장을 기각하기에 충분하다.
그럼에도 결과는 실용적 가치를 지닌다. 운영 시스템은 하나의 점수가 모든 사실 문제를 판정할 필요가 거의 없다. 더 비용이 큰 검증 경로를 정당화할 만큼 충분한 위험 사례를 신뢰성 있게 식별하는 관문이 필요하다.
내부 정책에 관한 질문에 답하는 기업용 어시스턴트를 생각해 보자. 생성 전 점수는 초안 작성이 시작되기 전에 위험한 프롬프트를 검색으로 라우팅할 수 있다. 최종 답변은 여전히 검색된 정책 문서의 뒷받침이 필요하다.
코딩 어시스턴트는 다른 환경을 제시한다. 관련 실패는 존재하지 않는 라이브러리 메서드, 호환되지 않는 버전, 또는 여러 파일에 걸친 잘못된 추론일 수 있다. 짧은 사실 답변에 맞춰 보정된 탐지기는 이 환경으로 전이되지 않을 수 있다.
장문 연구는 또 다른 경계를 만든다. 하나의 응답에는 수십 개의 주장이 담길 수 있으며, 일부는 뒷받침되고 다른 일부는 거짓일 수 있다. 첫 토큰 이전에 얻은 단일 점수는 이후 어떤 문장이 실패할지를 식별할 수 없다.
이 한계는 배포 범위를 주장 단위 검증과 혼동해서는 안 되는 이유를 설명한다. 탐지기는 프롬프트-응답 궤적이 위험한지를 추정할 수 있다. 하지만 뒤따르는 모든 명제의 진실성을 독립적으로 확립할 수는 없다.
관련 연구는 조기 신호의 가능성을 뒷받침한다. 2026년 논문 Before the First Token은 세 개의 사실성 데이터셋에서 나온 레이블된 예시 552개를 사용해 7개의 자기회귀 트랜스포머를 평가했다.
저자들은 4억 개 매개변수 미만 모델에서 우연 수준의 프로브 성능을 보고했다. 약 10억 개 매개변수 이상에서는 일부 모델에서 더 강한 생성 전 신호를 관찰했다. 이 패턴은 인스트럭션 튜닝에도 의존했다.
논문은 Pythia-1.4B와 Qwen2.5-7B에서 유의미한 위치-제로 효과를 발견했다. 그러나 더 큰 규모임에도 Pythia-6.9B는 평탄한 시간적 프로파일을 보였다. 이 비교는 매개변수 수에 기반한 단순한 규칙에 반대하는 근거가 된다.
연구자들은 탐지된 방향을 따라 활성화를 조정해도 환각이 수정되지 않았다고 보고했다. 즉, 이 신호는 인과적이 아니라 상관관계적이었다. 위험 상태를 탐지한다고 해서 그 상태를 바꾸었을 때 진실한 답변이 생성되는 것은 아니었다.
이 경계는 Reddit 주장을 해석하는 기준이 돼야 한다. 내부 패턴은 전용 진실 회로를 나타내지 않으면서도 결과를 예측할 수 있다. 이는 작업 난이도, 프롬프트 친숙도, 답변 가능성 또는 정확성과 상관된 다른 변수를 인코딩할 수 있다.
보편적 탐지기는 이러한 대안들을 구분해야 한다. 새로운 도메인, 프롬프트 형식, 언어, 모델 계열, 사후 훈련 형태에서도 성능을 유지해야 한다. 또한 그 가정을 의도적으로 깨뜨리려는 시도에도 견뎌야 한다.
그러므로 결과를 재현하거나 반박하라는 게시물의 요청은 핵심적이다. 다음 단계는 더 큰 헤드라인이 아니다. 두 번의 실패 사례와 원래 작업이 다루지 않은 환경을 중심으로 설계된 적대적 테스트 스위트다.
기존 탐지기는 문제의 서로 다른 부분을 해결한다
이 분야는 내부 기하학, 의미론적 불확실성, 외부 검증이 서로 다른 질문에 답하기 때문에 계층형 탐지로 수렴하고 있다.
영향력 있는 한 접근법은 의미론적 엔트로피, 즉 여러 생성 답변의 의미 전반에 걸친 불확실성을 측정한다. 반복된 답변이 서로 다른 주장을 표현한다면, 모델이 허구를 만들어내고 있을 가능성이 더 높다.
동료 심사를 거친 시맨틱 엔트로피 연구는 7B~70B 파라미터 규모의 LLaMA, Falcon, Mistral 계열을 테스트했다. 이 연구는 평가된 계열과 규모 전반에서 0.78~0.81의 안정적인 AUROC 값을 보고했다.
AUROC는 여러 임곗값에 걸쳐 점수가 양성 사례를 음성 사례보다 얼마나 잘 상위에 배치하는지를 측정한다. 이는 특정 애플리케이션에서 발생할 거짓 양성 비율을 알려주지는 않는다. 운영자는 여전히 비용 구조에 맞는 임곗값을 정해야 한다.
시맨틱 엔트로피는 생성 전 탐지기와 크게 다르다. Nature의 방법은 주요 문장 단위 실험에서 10개의 생성을 사용했다. 이후 변동성을 측정하기 전에 답변을 의미별로 그룹화했다.
이 절차는 샘플마다 달라지는 임의의 오답을 탐지할 수 있다. 반면 모델이 같은 거짓 주장을 확신에 차서 반복하는 경우는 놓칠 수 있다. 저자들은 이 방법의 대상을 환각으로 분류되는 모든 행동이 아니라 confabulation으로 명시적으로 한정했다.
비용 구조도 다르다. 여러 답변을 샘플링하고 그 의미를 비교하려면 하나의 내부 상태를 읽는 것보다 더 많은 계산이 필요하다. 특히 대부분의 쿼리가 일상적인 경우, 단일 패스 탐지기는 매력적인 초기 필터가 될 수 있다.
블랙박스 시스템은 또 다른 제약을 만든다. 상용 애플리케이션 개발자는 흔히 어텐션 맵, 잔차 스트림 또는 은닉 벡터를 살펴볼 수 없다. API를 통해 텍스트와, 경우에 따라 토큰 확률만 받는다.
따라서 내부 기하 구조는 오픈 웨이트 모델, 자체 호스팅 배포 또는 적절한 텔레메트리를 공개할 의향이 있는 제공업체에 유리하다. 시맨틱 일관성 방법은 블랙박스 텍스트 출력으로도 작동할 수 있지만, 반복 생성을 요구한다.
검색 기반 검증은 세 번째 경로를 택한다. 답변이 제공된 문서에 근거하는지 확인한다. 올바른 근거가 존재할 때 확신에 찬 오류를 잡아낼 수 있지만, 검색에는 자체적인 실패 모드가 따른다.
검색기가 오래된 정책을 반환하거나, 관련 구절을 누락하거나, 오해를 부르는 문서를 첫 번째로 순위화할 수 있다. 그러면 언어 모델은 자신의 문장을 뒷받침하지 않는 출처를 인용할 수 있다. 그라운딩 시스템에는 단순한 문서 존재 여부가 아니라 주장 단위의 검사가 필요하다.
고위험 사례에서는 여전히 사람의 검토가 필요하다. 위험 점수는 주의가 필요한 대상을 우선순위화할 수 있지만, 검토자는 원본 근거와 감사 추적에 접근할 수 있어야 한다. 검색 가능한 지식 베이스는 팀이 이러한 출처 맥락을 보존하는 데 도움이 될 수 있다.
이러한 방법은 직접적인 대체재가 아니라 계층으로 봐야 한다. 내부 탐지기는 모델의 계산이 위험 사례와 유사한지를 묻는다. 시맨틱 엔트로피는 샘플링된 의미가 안정적으로 유지되는지를 묻는다. 검색은 이용 가능한 근거가 주장을 뒷받침하는지를 묻는다.
프로덕션 파이프라인은 이 세 가지가 독립적이라는 전제 없이도 모두 결합할 수 있다. 초기 신호는 쿼리를 라우팅하고, 시맨틱 검사는 불확실한 출력을 살피며, 근거 검사는 중요한 주장을 검증한다. 사람 검토자는 그 결과가 비용을 정당화할 만한 사례를 처리한다.
신뢰도와 기하 구조 사이에 보고된 중복성은 이러한 계층적 관점을 강화한다. 같은 네트워크에서 더 많은 측정값을 추가한다고 해서 반드시 더 많은 지식이 추가되는 것은 아니다. 독립적인 근거는 시스템 어딘가에 반드시 들어와야 한다.
검증 격차는 여전히 크다
보고된 사전 등록은 신뢰도를 높이지만, 다른 이들이 실험을 검토하고 재현할 수 있기 전까지 공개된 주장은 여전히 불완전하다.
원문 게시물은 동료 심사를 거친 기록이 아니라 결과 요약을 제공한다. 독자는 발견을 평가하기 위해 등록 기록, 코드, 데이터셋, 모델 체크포인트, 프롬프트, 라벨, 그리고 배포 수준의 전체 결과를 확인할 필요가 있다.
“정직한 선택기”라는 표현에도 정확한 정의가 필요하다. 연구자가 평가 데이터를 사용해 지표, 레이어, 부호, 임곗값 또는 변환 방식을 선택하면 특성 선택 과정에서 정보 누수가 발생할 수 있다. 깔끔한 분할은 모든 적응적 결정을 포괄해야 한다.
모델당 하나의 신호를 선택하는 것은 두 번째 질문을 제기한다. 특성군은 폭넓게 전이될 수 있지만, 선택된 특성은 모델마다 다를 수 있다. 이는 어디서나 변경 없이 작동하는 하나의 고정된 탐지기보다 보편성이 낮다.
모델별 선택은 여전히 운영상 합리적일 수 있다. 팀은 일상적으로 배포별 안전성 임곗값을 보정한다. 그러나 주장은 보편적인 특성군과 고정된 파라미터를 가진 보편적 탐지기를 구분해야 한다.
실패한 두 배포는 집계 수치보다 더 많은 관심을 받을 만하다. 이들은 아키텍처, 작업, 규모, 튜닝 방식 또는 라벨 분포를 공유할 수 있다. 공통 원인을 찾는다면 제안된 하한선이 어디에서 무너지는지 알 수 있다.
정답 라벨을 둘러싼 불확실성도 중요하다. 환각 라벨은 작업이 사실 정확성, 맥락 충실성, 관련성 또는 논리적 일관성 중 무엇을 측정하는지에 따라 달라질 수 있다. 탐지기는 목표 정의를 알지 못하면 해석할 수 없다.
“생성 전”이라는 말 역시 기술적 선택을 감출 수 있다. 모델은 첫 출력 토큰을 선택하기 전에 이미 전체 프롬프트를 처리했다. 따라서 은닉 상태에는 프롬프트의 난이도, 친숙도, 예상 답변 내용이 인코딩될 수 있다.
이는 여전히 생성 전 탐지이지만, 모델 작업 없이 이뤄지는 예측은 아니다. 애플리케이션은 최소한 프롬프트 처리 패스를 완료해야 한다. 긴 컨텍스트에서는 이 단계가 추론 비용의 의미 있는 비중을 차지할 수 있다.
실험은 클래스 유병률과 신뢰구간도 보고해야 한다. 단순한 통과 횟수는 한 배포가 임곗값을 간신히 넘었는지, 다른 배포가 여유 있게 초과했는지를 가린다. 작은 테스트 세트는 불안정한 순위를 만들 수 있다.
적응형 공격도 또 다른 과제다. 사용자는 질문을 바꿔 표현하거나, 관련 없는 맥락을 주입하거나, 특정 답변 스타일을 요청하거나, 긴 추론을 강제할 수 있다. 일반적인 프롬프트로 보정된 탐지기는 프롬프트 구조가 바뀔 때 실패할 수 있다.
제품 브랜딩이 그대로여도 모델 업데이트는 내부 기하 구조를 바꿀 수 있다. 양자화, 파인튜닝, 어댑터, 시스템 프롬프트, 추론 설정은 모두 측정 신호를 변경할 수 있다. 각 변경에는 새로운 검증이 필요할 수 있다.
연구용 모델과 호스팅되는 프런티어 시스템 사이에도 차이가 있다. 아키텍처, 라우팅, 사후 학습 과정이 공개되지 않은 시스템으로 내부 상태 기술이 전이된다고 가정할 수는 없다.
모델이 왜 환각하는지에 관한 최근 연구는 또 다른 복잡성을 더한다. 2026년 평가 인센티브 연구는 다음 토큰 학습과 정확도 중심의 평가가 보류보다 추측을 보상한다고 주장했다.
탐지기는 위험한 추측을 표시할 수 있지만, 그것을 만들어낸 인센티브 자체를 바꾸지는 못한다. 배포 팀은 검색, 검증, 위험 탐지와 함께 적절한 거부를 보상하는 채점 규칙이 필요할 수 있다.
이러한 이유로 “20개 중 18개”는 조사의 끝이 아니라 시작이어야 한다. 유용한 재현 연구는 공개된 절차를 고정하고, 보지 못한 모델 계열을 테스트하며, 원래의 임곗값을 대체하지 않고 모든 실패를 공개할 것이다.
세 가지 테스트가 하한선의 유지 여부를 결정할 것이다
동일한 하한선이 독립 재현, 분포 이동, 프로덕션형 라우팅 테스트를 견딘다면 이 주장은 중요해진다.
첫 번째로 주목할 신호는 완전한 공개다. 여기에는 두 사전 등록 기록, 코드, 특성 정의, 모델 식별자, 작업 데이터, 라벨, 임곗값, 배포 수준 점수가 모두 포함되어야 한다.
공개는 정보 누수와 선택 결정을 감사 가능하게 만들어 주장을 강화할 것이다. 특히 성공한 구성만 제공된다면, 등록 기록이 없거나 모델별 결과가 불완전한 경우 주장은 약화될 것이다.
두 번째 신호는 보지 못한 모델과 작업에 대한 독립 재현이다. 가장 유익한 테스트에는 개발 과정에서 제외된 오픈 웨이트 아키텍처, 다국어 프롬프트, 장문 답변, 도구 사용, 문서 기반 생성이 포함될 것이다.
재현은 연구자가 무엇이든 튜닝하기 전에 원래 절차를 보존해야 한다. 성능이 도메인 이동 후에만 떨어진다면, 탐지기는 여전히 보정된 로컬 게이트 역할을 할 수 있다. 그러나 보편적 하한선을 뒷받침하지는 못할 것이다.
세 번째 신호는 운영 결과와 연결된 라우팅 시험이다. 연구자들은 초기 점수가 검색, 답변 보류, 재샘플링 또는 사람 검토를 촉발할 때 근거 없는 주장을 줄이는지 측정해야 한다.
이 시험에는 AUROC만으로는 부족하다. 거짓 경보, 누락된 오류, 지연 시간, 추가 계산량, 검토량, 승인된 답변의 정확도를 보고해야 한다. 이러한 측정값이 탐지기가 자원을 절약하는지, 아니면 단지 실수를 옮기는지를 결정한다.
가장 유망한 결과는 완벽한 진실 측정기가 아니다. 생성 전에 위험한 프롬프트의 안정적인 일부를 포착하고, 이를 진정으로 다른 검증 메커니즘에 넘기는 저비용의 첫 관문이다.
보고된 신뢰도 결과는 이러한 설계를 더 시급하게 만든다. 신뢰도와 기하 구조가 계속 중복된다면, 팀은 이 조합을 두 개의 독립적인 표로 취급하는 일을 멈춰야 한다. 내부 점수에 출처 검색 또는 주장 검증을 결합해야 한다.
이 작업을 평가하는 개발자는 즉시 세 가지 질문을 던질 수 있다. 탐지기는 우리 데이터에서 임곗값을 유지하는가? 누락 사례는 알아볼 수 있는 실패 유형 주변에 군집하는가? 표시된 프롬프트를 라우팅하면 모든 비용을 계산한 뒤 최종 정확도가 개선되는가?
더 넓은 머신러닝 커뮤니티는 고립된 일화가 아니라 통제된 테스트로 제안된 하한선을 깨뜨리려 해야 한다. 재현 실패는 주장의 범위를 좁힐 것이다. 재현 성공은 모든 환각을 탐지한다고 가장하지 않으면서도 유용한 공통 신호를 확립할 것이다.
이것이 보고된 결과의 진정한 가치다. 하나의 보편적 탐지기를 찾는 일을 측정 가능한 가설로 바꾼다. 모델 기하 구조는 폭넓은 조기 경고를 제공할 수 있지만, 진실에는 여전히 독립적인 근거가 필요하다.



