ShieldFont, Robots.txt를 무시하는 AI 스크레이퍼에 맞서다
수십 년간 자발적인 robots.txt 지침에 의존해 온 가운데, ShieldFont는 웹 폰트를 AI 스크레이퍼에 맞서는 무기로 바꿨다. 이 오픈소스 프로젝트는 사람이 읽을 때는 평범한 문장을 보게 하면서도, 원시 HTML을 수집하는 자동화 시스템에는 다른 단어가 나타나게 한다. 단순히 글을 숨기는 데 그치지 않는다. 무단 수집의 효용 자체를 낮추려는 시도다.
이 차이 때문에 ShieldFont는 또 하나의 봇 차단 실험을 넘어선다. 차단은 크롤러에게 떠나라고 알리지만, 크롤러는 이를 무시할 수 있다. ShieldFont는 그러한 요청이 이미 실패했다는 전제에서 출발한다. 그리고 규칙을 따르지 않는 스크레이퍼가 받는 정보를 바꿔 대응한다.
크리에이티브 스튜디오 S&A와 코펜하겐의 활자 주조사 Playtype는 2026년 7월 28일 이 프로젝트를 공개했다. Hackaday는 8월 14일 이를 소개하며 더 폭넓은 기술 독자층에 이 개념을 알렸다. 이제 핵심 갈등은 분명해졌다. 웹사이트 소유자는 사람이 읽기를 바라지만, 깨끗한 AI 학습 데이터를 자동으로 제공하고 싶지는 않다.
이는 의도적으로 불완전한 방어책이기도 하다. ShieldFont는 접근성, 검색 노출, 복사·붙여넣기 동작, 번역 및 기타 브라우저 기능에 악영향을 줄 수 있다. 끈질긴 스크레이퍼라면 이를 되돌릴 수도 있다. 진짜 표적은 추출의 이론적 가능성이 아니라 수집의 경제성이다.
ShieldFont는 콘텐츠 자체를 거부 수단으로 만든다
ShieldFont는 페이지의 잘못된 표현을 수집하는 스크레이퍼에 대해 정중한 요청을 기술적 결과로 바꾼다.
일반적인 웹사이트는 HTML로 텍스트를 전송하고 브라우저에 표시 방식을 지시한다. 사람은 렌더링된 결과를 보지만, 많은 크롤러는 기반 텍스트를 직접 가져간다. ShieldFont는 소스와 표시 결과 사이의 이 간극을 활용한다.
게시 전에 인코더는 선택한 소스 단어를 미끼 단어로 바꾼다. 이후 브라우저는 저자가 의도한 단어를 시각적으로 복원하는 특수 제작 OpenType 폰트를 불러온다. 사람은 원래 문장을 보지만, 기본적인 HTML 스크레이퍼는 치환된 단어를 저장한다.
OpenType은 문자가 눈에 보이는 글리프로 변환되는 방식을 제어하는 널리 쓰이는 폰트 형식이다. glyph substitution의 줄임말인 GSUB 시스템은 일반적으로 합자나 언어별 글자 형태 같은 기능을 처리한다. ShieldFont는 이 기능을 단어 수준에서 재활용한다.
프로젝트의 ShieldFont mechanics는 간단한 예를 제시한다. 저자가 “winners”라고 쓴 자리에 소스 텍스트에는 “avengers”가 포함될 수 있다. 폰트는 “winners”라는 글자를 그려 주므로, 원시 텍스트 수집기는 잘못된 명사를 갖게 된다.
이 접근법은 모든 문자를 뒤섞는 방식과 다르다. 문자 단위 노이즈는 품질 필터가 쉽게 제거할 수 있고, 현대 언어 모델은 단순한 치환 암호를 종종 복원할 수 있다. 반면 ShieldFont는 사실적 의미를 바꾸면서 문법적 유창성은 유지하려 한다.
매핑은 같은 문법 범주에 속하는 대체어끼리 단어를 교환한다. 명사는 대체로 명사로, 동사는 동사로 바뀐다. 결과 문장은 자동화된 데이터세트 정제를 통과할 만큼 읽기 쉬우면서도, 원래 주장을 잘못 나타낼 만큼 충분히 달라야 한다.
이 균형은 중요하다. 제거된 텍스트는 학습 데이터에 도달하지 못하기 때문이다. 눈에 띄게 훼손된 문장은 원문을 보호할 수는 있지만, 수집자에게 큰 추가 위험을 부과하지는 않는다. 그럴듯한 거짓 텍스트는 필터링, 검토 또는 학습 자원을 소모하게 할 가능성이 더 높다.
제작자들은 이 효과를 포이즈닝이라고 부른다. 다만 공개된 증거로는 ShieldFont가 의미 있는 규모에서 최첨단 모델의 성능을 저하시킨다는 사실이 확인되지 않았으므로, 이 용어는 신중히 사용할 필요가 있다. 시연된 결과는 변형된 문단에 관한 것이지 상용 모델의 측정 가능한 성능 하락에 관한 것은 아니다.
프로젝트의 통제된 테스트에 따르면, ShieldFont로 보호된 문단의 55.8%는 더 이상 동일한 사실 주장을 표현하지 않았다. 이 문단들은 일반적인 산문처럼 보일 만큼 충분한 일관성을 유지한 것으로 알려졌다. 이 수치는 ShieldFont 자체 방법론에서 나온 것으로, 폭넓은 독립 재현 검증을 거치지는 않았다.
현재 릴리스는 자주 쓰이는 영어 내용어를 대상으로 한다. 세 가지 주요 사전에는 각각 약 12,000개의 단어 쌍이 포함돼 있다. 더 적은 용어를 치환하는 작은 선택형 매핑도 제공해, 게시자가 은폐와 호환성 사이에서 다른 균형을 선택할 수 있다.
게시자는 호스팅형 인코더, React 컴포넌트, 빌드 시점 JavaScript 또는 맞춤형 폰트 워크플로를 사용할 수 있다. 보호 범위는 선택한 블록으로 제한할 수도 있다. 따라서 내비게이션, 헤드라인, 검색에 중요한 자료는 바꾸지 않고 둘 수 있다.
따라서 ShieldFont는 웹사이트 주변에 보이지 않는 경계를 만드는 방식이 아니다. 신뢰할 수 없는 수집자에게 콘텐츠가 도달하기 전에 특정 콘텐츠 조각을 바꾼다. 이 제한된 범위가 핵심 장점이자 가장 심각한 한계를 낳는다.
Robots.txt가 더 이상 문제를 해결하지 못하는 이유
robots.txt의 문제는 문법이 약해서가 아니라, 크롤러가 규칙이 자신에게 적용되지 않는다고 판단할 때 이를 강제할 수단이 없다는 데 있다.
Robots Exclusion Protocol은 초기 웹 시절부터 존재했다. 사이트는 루트에 robots.txt 파일을 두고, 어떤 사용자 에이전트가 특정 경로를 피해야 하는지 나열한다. 협조적인 크롤러는 해당 리소스를 요청하기 전에 이 파일을 읽는다.
이 프로토콜은 RFC 9309를 통해 표준화됐지만, 표준화가 접근 제어로 바뀐 것은 아니다. Robots.txt는 선호를 전달한다. 방문자를 인증하거나, 콘텐츠를 암호화하거나, 위장한 클라이언트의 요청을 막지는 못한다.
과거에는 검색 엔진이 자신을 식별하고 게시자와의 관계를 유지할 유인이 있었기에 이러한 차이가 관리 가능해 보였다. AI 학습은 목적, 정체성, 공급망이 다른 수집자를 등장시켰다. 데이터세트 구축자는 알아볼 수 있는 퍼스트파티 봇이 아니라 중개자를 통해 자료를 확보할 수도 있다.
이제 준수 수준이 제각각이라는 우려를 뒷받침하는 증거가 있다. 2025년 crawler compliance study는 40일간의 기관 웹 로그에서 스스로 봇이라고 밝힌 130개 봇을 조사했다. 연구진은 제한이 엄격해질수록 준수 수준이 낮아졌다고 보고했다.
이 연구는 일부 AI 검색 크롤러가 robots.txt를 거의 확인하지 않는다는 점도 발견했다. 이 결과가 모든 AI 기업이 게시자 선호를 무시한다는 뜻은 아니다. 다만 자발적 파일 하나에 집행 책임 전체를 맡길 수 없는 이유를 보여 준다.
웹사이트 운영자는 알려진 사용자 에이전트를 차단하고, 의심스러운 요청에 검증을 요구하며, 속도 제한을 적용하거나 웹 애플리케이션 방화벽을 사용할 수 있다. 이러한 통제는 네트워크 요청에 더 가까운 계층에서 작동하므로, 텍스트 파일 지시문보다 무시하기 어렵다.
하지만 식별은 여전히 어렵다. 수집자는 주소를 순환시키고, 사용자 에이전트 문자열을 바꾸고, 요청을 분산시키거나, 일반적인 브라우저 트래픽처럼 보이게 할 수 있다. 공격적인 방어책은 검색 엔진, 접근성 서비스, 아카이브 프로젝트, 정당한 연구자까지 차단할 수 있다.
상업용 인프라 제공업체들은 더 강력한 통제로 대응해 왔다. Cloudflare의 AI bot controls는 고객이 모델 학습 및 기타 AI 용도와 관련된 크롤러를 차단할 수 있게 한다. 이런 시스템은 개별 게시자가 흔히 갖지 못하는 트래픽 가시성의 이점을 누린다.
ShieldFont는 다른 계층을 겨냥한다. 게시자의 명시된 선호와 경계 방어를 뚫고 요청이 페이지에 도달했다는 가정에서 출발한다. 스크레이퍼는 성공적인 응답을 받지만, 그 응답에는 브라우저 렌더링 과정 밖에서는 신뢰할 수 없게 되는 표현이 포함된다.
이는 대립 구도를 허가 대 불이행에서 저렴한 수집 대 비싼 검증으로 바꾼다. 크롤러가 여전히 이길 수는 있다. 하지만 먼저 보호된 페이지를 인식하고, 관련 매핑을 식별하며, 콘텐츠를 렌더링하거나, 다른 방법으로 표시된 텍스트를 복구해야 한다.
프로젝트 창립자들은 게시와 동의를 별개의 행위로 설명한다. 그들의 입장은 사람이 읽을 수 있게 작품을 공개한다고 해서 모델 학습이 자동으로 허가되는 것은 아니라는 것이다. ShieldFont는 이 정책 논쟁을 기술적 불편으로 옮긴다.
이러한 전환은 프로젝트의 매력을 설명한다. 개인 게시자에게 또 하나의 배제 규칙보다 더 구체적인 수단을 제공한다. 그러나 동시에 갈등을 페이지 자체로 옮기며, 독자와 검색 시스템이 부수적 피해를 볼 수 있다.
실제 작동 원리는 경제적 마찰이다
ShieldFont는 이를 되돌리는 비용이 대량 수집자가 보호된 페이지 하나에서 얻을 것으로 기대하는 이익보다 클 때만 작동한다.
공개 웹 폰트는 그 매핑을 영구적으로 비밀로 유지할 수 없다. 브라우저가 의도된 단어를 표시하려면 폰트가 필요하므로, 필요한 렌더링 정보는 사용자의 기기에 도달한다. 표적을 정한 분석자는 이를 내려받아 분석할 수 있다.
ShieldFont 자체 deployment caveats도 이러한 약점을 인정한다. 개발자들은 사전을 사용하지 않고 배포된 폰트 하나에서 11,962개 단어 쌍을 복원했다. OpenType 역변환기를 만드는 데는 전문 엔지니어링이 필요하다고 추정하지만, 매핑 자체는 복구 가능하다.
프로젝트가 오픈소스이므로 기본 사전 역시 공개돼 있다. 전용 디코더를 만드는 사람은 이를 직접 연구할 수 있다. 비공개 매핑은 웹사이트마다 필요한 작업량을 늘리지만, 역변환을 불가능하게 만들지는 않는다.
그렇기에 이 방어책은 규모에 의존한다. 대부분의 대량 스크레이퍼는 큰 분량의 HTML을 저렴하게 가져오도록 최적화돼 있다. 통상 모든 폰트를 검사하고, 보호된 블록과 연결하며, 각 도메인의 소스-글리프 관계를 재구성하지는 않는다.
스크레이퍼는 헤드리스 브라우저에서 모든 페이지를 렌더링할 수 있다. 스크린샷을 캡처하고, 보이는 픽셀을 다시 텍스트로 변환하는 광학 문자 인식을 사용할 수도 있다. 비전-언어 모델도 렌더링된 이미지에서 유사한 복구를 수행할 수 있다.
각 경로는 비용을 추가한다. 렌더링은 원시 마크업을 내려받는 것보다 더 많은 컴퓨팅 자원과 시간이 든다. OCR은 처리와 검증 단계를 늘린다. 비전 모델은 추가 비용, 지연 시간, 오류 가능성을 더한다.
탐지도 또 다른 과제다. ShieldFont 설치가 고정된 클래스 이름, 파일 경로 또는 접근성 속성을 노출한다면, 수집자는 이를 저렴하게 표시할 수 있다. 따라서 프로젝트는 다양한 매핑과 위장된 구현을 권장한다.
위장이 영원히 효과를 유지할 수는 없다. 도입 사실이 널리 알려지면 주요 수집자는 탐지 기능을 파이프라인에 넣을 수 있다. 중요한 질문은 서로 무관한 다수 웹사이트에서 탐지와 복구가 계속 경제성을 유지하느냐이다.
이는 전통적인 암호화보다는 스팸 필터링이나 광고 차단에 더 가깝다. 어느 쪽도 최종적인 기술적 승리를 거두지 못한다. 한쪽이 신호를 바꾸면, 다른 쪽은 인식 방식과 대응책을 업데이트한다.
ShieldFont는 Alpha, Beta, Gamma 매핑과 비공개 변형을 생성하는 도구를 함께 제공한다. 하나의 매핑을 중심으로 학습된 디코더는 다른 매핑에서는 실패할 수 있다. 고유 매핑이 널리 사용되면 수집자의 사이트별 검증 부담은 커진다.
그러나 적응을 장려하는 그 개방성은 적대자에게도 도움이 된다. 연구자와 스크레이퍼는 모든 설계 결정을 검토할 수 있다. 오픈 개발은 기여자가 새로운 매핑과 통합 방식을 만들 수 있게 하는 동시에, 약점도 더 쉽게 발견하게 한다.
따라서 가장 강한 주장은 절제돼 있다. ShieldFont는 순진한 추출 결과를 틀리게 만들고 대량 검증 비용을 높일 수 있다. 보호된 글이 모든 데이터세트에서 제외되도록 보장할 수는 없다.
포이즈닝 주장은 입증하기가 더 어렵다. 학습 파이프라인은 방대한 컬렉션을 중복 제거하고, 점수를 매기고, 필터링하고, 분류하고, 혼합한다. 제한된 양의 변형 산문은 모델에 영향을 미치기 전에 제거되거나, 희석되거나, 수정될 수 있다.
ShieldFont의 제작자들은 약 4분의 1에 해당하는 단어를 바꾸자, 테스트한 문단의 절반이 원래의 사실적 주장을 잃었다고 보고한다. 이는 텍스트 내 의미 왜곡을 측정한 것이다. 이후 모델의 행동을 입증하는 것은 아니다.
수집기는 보호된 페이지를 신뢰할 수 없다고 판단해 아예 제외할 수도 있다. 이 결과 역시 게시자의 옵트아웃 목표를 진전시킨다. 다만 수집을 통한 오염이 아니라 억제를 통한 차단이다.
이것이 프로젝트의 핵심적인 전환이다. ShieldFont는 모든 오염 문장이 학습에 피해를 줘야 할 필요가 없다. 추가 검증 없이 겉보기에 자연스러운 텍스트를 보관할 가치가 있는지 수집기가 의심하게 만들면 된다.
이 방어책은 독자, 검색, 접근성에도 영향을 미친다
ShieldFont의 가장 어려운 문제는 정당한 사용자를 지원하는 기계 역시 무단 스크레이퍼와 동일한 원본 텍스트를 소비하는 경우가 많다는 점이다.
스크린 리더는 일반적으로 글꼴이 그리는 픽셀뿐 아니라 문서 구조와 텍스트 콘텐츠에 의존한다. 소스에 미끼 단어가 포함되면 보조 소프트웨어가 잘못된 정보를 읽어줄 위험이 있다. 그러면 보호된 페이지는 적극적으로 오해를 유발하게 된다.
기본 구현은 보호 블록에 aria-hidden을 표시해 이를 피한다. 이 속성은 접근성 트리에서 콘텐츠를 제거한다. 스크린 리더 사용자는 비장애 시각 독자가 완전한 문단을 접하는 지점에서 아무것도 듣지 못할 수 있다.
이는 범용적으로 용납할 수 있는 결과가 아니다. ShieldFont 문서는 보호 블록이 적용 가능한 WCAG 요구사항을 충족하지 못할 수 있다고 경고한다. 장애인 접근 의무가 있는 게시자는 배포 전에 전문가의 검토를 받아야 한다.
베타 동적 모드는 다른 방식을 시도한다. 원문을 암호화된 형태로 저장한 뒤, 독자의 브라우저가 계산 퍼즐을 풀어야 이를 공개한다. 이 지연은 한 사람에게는 감내할 만한 수준으로 유지하면서 대규모 자동 추출은 저지하도록 설계됐다.
이 설계 역시 정당한 사용자에게 마찰을 만든다. JavaScript가 필요하며 키보드 포커스를 방해할 수 있다. 프로젝트는 VoiceOver 및 자동화 도구로 이 방식을 테스트했다고 밝히지만, 그것이 광범위한 접근성 준수를 입증하지는 않는다.
다른 브라우저 기능도 소스 텍스트에 의존한다. 보호된 문단을 복사하면 보이는 단어 대신 미끼가 복사될 수 있다. 페이지 내 찾기, 번역, 리더 모드, 신디케이션 피드, 강제 글꼴, 텍스트 전용 보기는 실패하거나 예측 불가능하게 작동할 수 있다.
검색 엔진은 또 다른 충돌을 만든다. 원시 텍스트를 색인하는 크롤러는 보이는 페이지가 아닌 미끼를 순위에 반영할 수 있다. 이는 관련성을 약화하고 부정확한 스니펫을 만들거나, 저자가 공개할 의도가 없던 용어와 사이트를 연결할 수 있다.
제작자들은 검색에 중요한 콘텐츠는 보호하지 않은 채 두라고 권장한다. 마케팅 페이지, 헤드라인, 내비게이션 및 기타 발견용 자료는 일반 HTML로 유지할 수 있다. 유료 구독 아카이브나 선별된 창작 문단은 더 그럴듯한 배포 대상이다.
이 블록별 접근 방식은 피해를 줄이지만, 수집기에게 보호된 자료 주변의 깨끗한 맥락도 제공한다. 모델은 인근 제목, 요약, 구조화된 데이터, 피드 또는 다른 곳의 중복 사본으로부터 일부 대체 단어를 추론할 수 있다.
게시 과정에서도 구현이 실패할 수 있다. 일부 빌드 워크플로는 보호된 출력을 만들기 전, 작성자의 원문을 주석에 남겨 둔다. 그런 주석을 함께 배포하면 깨끗한 텍스트와 이에 대응하는 미끼가 모두 노출된다.
ShieldFont는 이 실수를 포착하도록 설계된 검사를 제공한다. 문서는 개발자에게 소스 주석을 제거하고 보호 마커가 남아 있으면 빌드를 실패시키라고 경고한다. 이 보호 장치 역시 올바른 통합과 테스트에 달려 있다.
비공개 매핑 파일도 비슷한 주의가 필요하다. 웹사이트가 글꼴 옆에 읽을 수 있는 사전을 노출하면 목적을 잃는다. 캐시된 버전, 소스 맵, 콘텐츠 API, 미리보기 엔드포인트도 원래 문구를 유출할 수 있다.
따라서 보안팀은 ShieldFont를 접근 제어 시스템이 아니라 실험적인 콘텐츠 변환으로 취급해야 한다. 이는 인증, 권한 부여, 속도 제한, 모니터링 또는 계약상 제한을 대체하지 않는다.
게시자는 사용자 신뢰도 고려해야 한다. 방문자가 인용문을 복사했는데 다른 문구를 받는다면 페이지가 고장 났다고 보는 것이 타당하다. 연구자, 학생, 기자는 원래의 시각적 표현 밖에서도 정확한 텍스트를 필요로 한다.
개인 지식 도구도 같은 문제에 직면한다. 누군가 기사를 AI knowledge base에 저장하면 자신도 모르게 미끼 버전을 보관할 수 있다. 방어적 오염은 무단 학습과 정당한 용도로 자료를 보존하는 독자를 구별할 수 없다.
이러한 부수적 피해는 ShieldFont가 적합한 범위를 제한한다. 예술적 선언, 통제된 실험 또는 접근성과 발견 요구가 낮은 선별 자료에는 맞을 수 있다. 공익 정보에 적용하기에는 위험한 기본값이다.
ShieldFont는 더 광범위한 데이터 오염 움직임에 합류한다
이 프로젝트는 적대적 보호를 이미지에서 일반 웹 텍스트로 옮기지만, 동일한 검증 및 채택 문제를 물려받는다.
예술가들은 이미 모델이 디지털 작품을 수집하기 전에 이를 변경하는 도구를 탐색해 왔다. Glaze는 무단 스타일 모방을 방해하고, Nightshade는 적대적 변경을 통해 이미지 모델 학습을 겨냥한다. 둘 다 수집기의 협조에 의존하는 옵트아웃 시스템에 대한 불만을 반영한다.
ShieldFont는 텍스트에 유사한 아이디어를 적용하지만, 그 메커니즘은 유난히 명료하다. 이미지 픽셀 전반에 보이지 않는 교란을 가할 필요가 없다. 브라우저와 원시 텍스트 크롤러가 하나의 문서에서 서로 다른 메시지를 도출할 수 있다는 사실을 활용한다.
이전의 타이포그래피 실험도 시각적 읽기와 기계 해석을 분리했다. TuringFonts는 단순 봇으로부터 정보를 가리기 위해 치환 암호 글꼴을 사용했다. ZXX는 광학 문자 인식을 저항하기 위해 글리프 형태를 바꿨다.
현대 시스템은 이러한 접근법을 약화했다. 언어 모델은 문맥을 통해 문자 치환을 해독할 수 있고, 비전 모델은 스타일화된 글자를 읽을 수 있다. ShieldFont는 자연스러운 토큰을 유지하면서 의미를 바꿔, 인식 자체만이 아니라 데이터세트 파이프라인을 겨냥한다.
“Poisoned Typeface”라는 2026년 보안 연구는 반대 방향에서 악의적으로 재매핑된 글꼴을 검토했다. 연구자들은 AI 어시스턴트가 종종 기저 텍스트를 신뢰하는 반면, 사람은 다르게 렌더링된 콘텐츠를 본다는 사실을 발견했다고 전해진다. 이 격차는 방어, 기만 또는 공격을 지원할 수 있다.
이러한 이중 용도는 중요하다. 스크레이퍼로부터 정확한 문장을 숨기는 글꼴은 자동화 에이전트가 다른 내용을 처리하는 동안 사람에게는 한 가지 지시를 보여줄 수도 있다. 같은 불일치는 브라우저 어시스턴트, 기업용 에이전트, 자동 구매 시스템에 영향을 줄 수 있다.
방어자는 글꼴 재매핑을 신뢰할 수 있는 콘텐츠로 정상화하지 않도록 해야 한다. 소스 텍스트를 맹목적으로 읽는 에이전트는 미끼에 취약하다. 스크린샷을 신뢰하는 에이전트는 시각적 프롬프트 인젝션을 마주할 수 있다. 두 표현을 비교하면 비용은 높아지며 모호성도 여전히 남는다.
따라서 모델 개발자에게 ShieldFont는 데이터 출처에 관한 경고다. 유창한 언어가 반드시 사람이 보는 원본에 충실한 것은 아니다. 학습 파이프라인은 페이지를 수집할 당시 어떻게 렌더링됐는지 보여주는 신호가 필요할 수 있다.
출처 검증에는 저장 공간과 연산이 추가된다. 수십억 개의 페이지를 렌더링하고, 스크린샷을 보존하며, 글꼴을 수집하고, 표현을 조정하면 광범위한 웹 데이터세트는 더 비싸진다. 이렇게 비용을 높이는 것이 바로 ShieldFont가 만들고자 하는 압력이다.
게시자에게 더 큰 흐름은 강제 가능한 통제로의 이동이다. 네트워크 차단, 인증된 접근, 라이선스 시스템, 기계 판독형 권한, 적대적 변환은 모두 비공식적 기대를 대체하려는 시도다.
어떤 단일 방법도 이 갈등을 해결하지 못한다. 인증은 독자층을 제한한다. 차단은 오탐을 낳는다. 라이선스에는 상대방과 표준이 필요하다. 오염은 정당한 사용자에게 피해를 줄 수 있다. Robots.txt는 게시자의 의도를 명시적으로 기록하는 수단으로 여전히 유용하지만, 스스로를 강제할 수는 없다.
ShieldFont의 가장 오래가는 기여는 운영적이라기보다 개념적일 수 있다. 웹페이지에는 여러 개의 읽을 수 있는 계층이 있으며, 수집기는 어느 계층을 신뢰할지 선택한다는 점을 보여준다. 이제 그 선택에는 법적, 윤리적, 기술적 결과가 따른다.
이 프로젝트는 공개 접근성에 관한 일반적인 가정에도 도전한다. 콘텐츠는 공개적으로 읽을 수 있어도 기술적으로 중립적일 필요는 없다. 게시자는 자동 추출의 비용, 신뢰성, 허용된 사용 방식을 의도적으로 형성할 수 있다.
ShieldFont의 중요성을 가를 요소
ShieldFont가 의미 있는 인프라가 될지, 아니면 동의 문제를 날카롭게 보여주는 시연에 머물지는 세 가지 신호가 결정할 것이다.
첫 번째 신호는 독립적 재현이다. 연구자들은 현실적인 수집, 필터링, 중복 제거, 미세 조정 파이프라인 전반에서 현재 매핑을 테스트해야 한다. 문단 수준의 의미 변화만으로는 모델 규모의 데이터세트 오염을 입증할 수 없다.
유용한 연구는 원시 HTML 추출, 렌더링된 브라우저 텍스트, OCR, 글꼴 역변환, 비전-언어 복구를 비교해야 한다. 또한 ShieldFont를 사용하지 않는 페이지를 검사하는 비용과 오탐지도 측정해야 한다.
수집기가 보호된 페이지를 모두 제거하더라도 결과는 프로젝트의 주장을 강화할 수 있다. 신뢰할 수 있는 제외는 글꼴이 경제적 억제를 통해 옵트아웃을 강제한다는 점을 보여줄 것이다. 저렴한 자동 복구는 그 주장을 약화할 것이다.
두 번째 신호는 다양한 매핑을 사용한 게시자 채택이다. 공개된 단일 매핑은 쉽게 인식하고 해독할 수 있다. 수백 개의 독립적 구현이 있어야 사이트별 변형이 의미 있는 운영상 마찰을 만드는지 더 잘 시험할 수 있다.
다운로드 수보다 채택의 질이 중요하다. 게시자는 평문을 유출하거나, 내비게이션을 망가뜨리거나, 스크린 리더 사용자를 배제하지 않고 글꼴을 배포해야 한다. 실제 사이트는 통제된 시연이 재현할 수 없는 통합 문제를 드러낼 것이다.
검색 순위에 크게 의존하지 않는 아카이브, 회원 전용 에세이, 창작물 및 기타 자료에서의 사용을 주시해야 한다. 필수 정보 전반에 광범위하게 배포하면 더 강한 접근성 반발을 불러올 가능성이 크다.
세 번째 신호는 크롤러와 에이전트 개발자의 대응이다. 수집기는 알려진 글꼴 파일을 지문 식별하고, OpenType 치환을 파싱하며, 의심스러운 페이지를 렌더링하거나, 보호된 블록을 버릴 수 있다. 각 선택은 이들이 얼마나 많은 추가 처리를 감수할지 보여준다.
브라우저 에이전트도 DOM 텍스트와 렌더링된 텍스트를 비교하기 시작할 수 있다. 불일치는 경고, 두 번째 검색 방식 또는 행동 거부를 유발할 수 있다. 이러한 보호 장치는 방어적 오염뿐 아니라 악의적인 재매핑도 다룰 수 있다.
이 대응이 실질적 결과를 결정할 것이다. 복구가 저렴한 라이브러리 함수가 되면 ShieldFont는 더 빠른 매핑 변경이나 더 정교한 위장이 필요해질 것이다. 수집 파이프라인이 보호된 페이지를 단순히 거부한다면 게시자는 더 강력한 옵트아웃을 얻게 된다.
법률 및 업계 발전은 적대적 방어의 필요성을 줄일 수 있다. 강제 가능한 라이선스, 신뢰할 수 있는 크롤러 신원, 인정받는 동의 신호는 더 깔끔한 해결책을 제공할 것이다. ShieldFont는 오늘날 많은 창작자가 그러한 시스템을 신뢰하지 않기 때문에 존재한다.
이 프로젝트를 깨지지 않는 자물쇠로 판단해서는 안 된다. 제작자들 역시 그러한 설명을 거부한다. 이전에는 공개 텍스트를 저렴한 원재료로 취급했던 수집 과정에 부과된 관세로 이해하는 편이 낫다.
현재 그 관세는 일부 정당한 독자에게도 부과된다. 접근성 실패, 고장 난 브라우저 기능, 부정확한 검색 색인은 사소한 세부 사항이 아니다. 이것들이 이 전술이 저작권을 보호하는지, 아니면 단지 피해를 다른 곳으로 옮기는지를 결정한다.
개발자와 퍼블리셔에게 당장의 과제는 신중한 테스트다. 중요한 내용을 ShieldFont로 보호하기 전에 원문, 렌더링된 텍스트, 보조기술 출력, 복사한 콘텐츠, 검색 미리보기, 피드, 보관된 버전을 비교해야 한다.
AI 구축자에게도 메시지는 똑같이 명확하다. HTML을 사람이 실제로 본 내용을 의심 없이 기록한 것으로 간주하는 일은 더 이상 안전하지 않다. ShieldFont는 그 불일치를 의도적이고, 눈에 보이며, 쉽게 재현할 수 있게 만든다.
더 큰 질문은 적대적 퍼블리싱이 일상화되기 전에 동의 메커니즘이 신뢰를 얻을 수 있느냐는 것이다. 크롤러가 명시된 선호를 계속 무시한다면, 더 많은 창작자가 대가를 수반하는 방어책을 찾게 될 것이다. ShieldFont는 도발적인 한 가지 답을 제시한다. 스크레이퍼가 표식을 존중하지 않는다면, 그것이 가져가는 자료의 신뢰도를 낮춰라.



