top of page

Sakana AI 피어 리뷰, 핵심 오류 73% 포착했지만 실제 논문은 한계 드러내

2시간 전
10분 분량

Sakana AI는 자사의 피어 리뷰 시스템이 논문의 핵심 주장에 영향을 주는 의도적 오류 중 73.43%를 탐지했다고 밝혔다. 그러나 이 눈에 띄는 결과는 원본 연구를 일상적으로 검토한 결과가 아니라, 합성된 모순을 대상으로 한 네 차례의 리뷰에서 나왔다.

Multi-Layered Review라 불리는 이 시스템은 Sakana AI의 새 벤치마크에서 세 가지 자동 리뷰 기준선보다 훨씬 뛰어난 성과를 보였다. 하지만 철회된 arXiv 논문에서 문서화된 문제를 대상으로 시험했을 때 정확한 탐지율은 16.11%로 떨어졌다.

이 격차가 핵심이다. Sakana AI 피어 리뷰는 신중한 다회차 읽기가 자동화된 비평을 개선할 수 있다는 근거를 제시한다. 그렇다고 LLM이 과학 연구를 신뢰성 있게 검증할 수 있음을 입증하는 것은 아니다.

오히려 이 연구는 개발자들에게 AI 리뷰어의 평가 방식을 재고하라고 요구한다. 인간 점수와 일치하거나 설득력 있는 피드백을 내놓는 것만으로는 충분하지 않다. 유용한 리뷰어라면 주장, 방법, 실험, 증거를 서로 충돌하는 지점을 찾아낼 수 있을 만큼 잘 연결해야 한다.

Sakana AI의 결과는 복잡한 전사와도 맞물린다. 이 회사는 이전에 AI로 과학 논문을 생성했고, 피어 리뷰 통과가 실제로 무엇을 증명하는지에 대한 의문에 직면했다. 최신 프로젝트는 AI가 취약한 연구를 찾아내는 데 인간을 도울 수 있는지를 묻는 방식으로 같은 우려를 뒤집어 본다.

Sakana AI 피어 리뷰, 평가 방식을 바꾸다

가장 중요한 변화는 73.43%라는 결과 자체가 아니다. AI 리뷰어를 오류 포착 여부로 평가하기로 한 결정이다.

자동화된 피어 리뷰에 관한 초기 연구의 상당수는 유사성을 측정했다. 연구자들은 AI가 생성한 리뷰를 인간 피드백과 비교하고, 점수의 상관관계를 확인하거나 의견 간 중복도를 측정했다.

이러한 시험은 시스템이 리뷰어처럼 행동하는지를 포착한다. 그러나 논문의 핵심 오류를 알아차렸는지를 직접 보여주지는 않는다.

Sakana AI의 피어 리뷰 논문은 검증에 초점을 맞춘 대안을 제안한다. 저자들은 오류 탐지가 피어 리뷰의 가장 중요하면서도 자원 소모가 큰 기능 중 하나라고 주장한다.

연구팀은 수정된 논문 변형 1,164개로 구성된 Contradiction Benchmark를 만들었다. 이 변형들은 2025년 ACL, AISTATS, CVPR, ICML과 2024년 NeurIPS에 발표된 257편의 논문에서 나왔다.

연구자들은 허용적인 Creative Commons 라이선스를 가진 논문으로 수집 범위를 제한했다. 이 제한 덕분에 원고를 수정하고 재배포할 수 있었다.

각 논문에 대해 Gemini 2.5 Pro는 지식 그래프를 생성했다. 지식 그래프는 주장, 방법, 증거 및 이들 간의 관계를 연결된 노드로 표현한다.

그다음 연구자들은 각 노드와 주요 주장 사이의 거리를 측정했다. 거리가 0이면 해당 노드는 핵심 주장을 나타냈다. 거리가 멀어질수록 점차 주변적인 세부 사항을 나타냈다.

GPT-4.1은 선택된 구절을 해당 노드와 모순되도록 다시 작성했다. 변경된 텍스트는 원본 소스에 삽입된 뒤 완전한 PDF로 다시 컴파일됐다.

이 절차는 연구자들에게 알려진 오류와 알려진 위치를 제공했다. 또한 각 오류가 논문의 주요 결론을 얼마나 직접적으로 위협하는지 분류할 수 있게 했다.

o3 모델은 생성된 리뷰가 각 모순을 탐지했는지 판정했다. 판정 과정은 예시마다 열 번 실행됐고, 연구자들은 결과를 평균 냈다.

연구에 따르면 판정기는 오류가 없는 논문에서 99.9%의 정확도에 도달했다. 수동 분석에서는 확인된 탐지에 대해 86.8%의 민감도가 나타났으며, 이는 자동 채점이 때때로 정당한 탐지를 놓쳤음을 시사한다.

이 설정은 모델이 리뷰어처럼 들리는지를 묻는 것보다 더 명확한 시험을 제공한다. 시스템이 의도적으로 심은 모순을 제기하거나, 그렇지 않거나 둘 중 하나다.

다만 이 벤치마크는 리뷰의 신중하게 정의된 한 부분을 측정한다. 데이터 조작, 부적절한 통계적 가정, 숨겨진 전처리 오류, 재현 불가능한 실험을 포함한 모든 형태의 과학적 실패를 다루지는 않는다.

이 구분은 헤드라인의 수치가 특히 핵심 주장 모순을 가리키기 때문에 중요하다. 이를 과학 리뷰의 일반적인 73% 정확도율로 읽어서는 안 된다.

Sakana AI MLR 시스템이 더 많은 오류를 찾는 이유

Multi-Layered Review는 논문을 판단하기 전에 모델이 논문을 이해하도록 강제함으로써 오류 탐지를 개선한다.

완전한 Sakana AI MLR 시스템은 Appendix Agent, Literature Review Agent, Review Agent라는 세 가지 역할로 구성된다. 이 구성 요소들은 통합 평가를 내놓기 전에 원고의 서로 다른 부분을 처리한다.

Appendix Agent는 Claude Haiku 3.5를 사용해 본문 밖의 구현 및 실험 세부 사항을 요약한다. 이 단계는 부록에서 이미 다룬 내용을 시스템이 누락 사항으로 비판하는 일을 방지하는 데 도움이 된다.

선택적인 Literature Review Agent는 Claude Sonnet 4와 웹 검색을 사용한다. 이 에이전트의 역할은 원고를 기존 연구 맥락에 배치하고, 새로움에 대한 주장이 정당해 보이는지 시험하는 것이다.

중심 역할을 하는 Review Agent 역시 Claude Sonnet 4를 사용한다. 이 에이전트는 PDF 형태의 본문을 최대 10페이지까지 받아, 일반 텍스트 추출 과정에서 손상될 수 있는 수식, 차트, 레이아웃 정보를 보존한다.

이 워크플로는 연구 논문을 읽기 위한 확립된 3단계 읽기 방법을 따른다. 첫 번째 단계에서는 원고의 핵심 아이디어를 개괄적으로 정리한다.

두 번째 단계에서는 더 면밀히 읽고 그 아이디어를 뒷받침하는 증거와 연결한다. 또한 가정, 공백, 약점을 기록한다.

세 번째 단계에서는 이 메모를 관련 부록 및 문헌 검토 결과와 결합한다. 이어 강점, 약점, 질문, 권고안, 점수, 조치 목록을 작성한다.

이 순서는 LLM 리뷰 도구에서 흔히 발생하는 실패를 겨냥한다. 하나의 대형 프롬프트는 모델에게 논문을 요약하고, 검증하고, 비교하고, 비판하고, 점수를 매기고, 형식화하라고 한꺼번에 요구할 수 있다.

모델은 연구에 대한 안정적인 표현을 구축하지 않은 채 완성도 높은 리뷰를 만들 수 있다. 초록의 주장을 반복하면서 결과에 담긴 반대 증거를 간과할 수 있다.

MLR은 이해와 평가를 분리한다. 이 설계는 모델에 결론과 이를 뒷받침하는 방법 또는 실험을 연결할 수 있는 중간 메모를 제공한다.

벤치마크 결과는 모델 선택과 워크플로 설계가 모두 개선에 기여했음을 시사한다. 더 단순한 LLM-Review 기준선에서 GPT-4.1을 Claude Sonnet 4로 교체하자 핵심 오류 탐지율은 14.56%에서 35.40%로 올랐다.

이후 단일 MLR 리뷰는 같은 핵심 모순 범주에서 60.79%에 도달했다. 네 개의 MLR 리뷰 앙상블은 탐지율을 73.43%까지 끌어올렸다.

핵심 주장 오류에서 경쟁 시스템의 최고 결과는 AgentReview가 기록한 14.81%였다. AI Reviewer는 11.17%에 도달했으며, 원래 LLM-Review 구성은 14.56%를 기록했다.

측정된 모든 심각도 수준의 모순을 통틀어 네 개의 MLR 리뷰는 40.95%를 탐지했다. 경쟁 시스템은 5.95%에서 6.50% 사이에 머물렀다.

이러한 비교는 절대 점수보다 작동 방식 자체를 더 흥미롭게 만든다. 기반 모델을 바꾼 것은 큰 향상을 만들었고, 다회차 리뷰 설계는 추가 향상을 이끌었다.

이는 구매자가 성능을 설명하는 데 “멀티 에이전트”라는 표현만으로 충분하다고 볼 수 없다는 뜻이다. AgentReview 역시 리뷰어, 저자, 분야 의장 역할을 사용하지만 벤치마크 성과는 훨씬 낮았다.

중요한 질문은 에이전트가 무엇을 하느냐이다. 하나의 작업을 여러 페르소나에 나누는 것은 원고를 증거를 담은 구성 요소로 분해하고 반복된 단계에 걸쳐 이해를 구축하는 것과 다르다.

MLR은 더 많은 토큰이 자동으로 더 높은 리뷰 품질을 낸다는 가정에도 도전한다. 연구에서 완전한 리뷰당 입력 토큰 189,062개를 사용했는데, 이는 AI Reviewer의 403,654개보다 절반도 안 된다.

더 단순한 LLM-Review는 긴 내용을 잘라냈기 때문에 부분적으로 입력 토큰 6,517개만 사용했다. 이 방식은 자원을 덜 소비했지만, 모순을 드러낼 수 있는 정보를 잃었다.

따라서 유용한 절충점은 단순히 작으냐 크냐의 문제가 아니다. 시스템이 논문을 검토 가능한 모델로 구축하는 데 맥락을 쓰는지 여부다.

벤치마크 밖에서 축소되는 73% 주장

MLR을 자율적인 심판으로 간주하는 데 가장 강력한 반증은 Sakana AI 자체의 실제 오류 평가에서 나온다.

연구자들은 철회된 arXiv 논문과 이에 연관된 철회 의견을 기반으로 한 데이터세트인 WithdrarXiv-Check를 대상으로 Review Agent를 시험했다. 이 데이터세트의 테스트 세트에는 211편의 논문이 포함돼 있다.

이 평가는 의도적으로 심은 모순을 탐지하는 것보다 어렵다. 실제 연구 오류는 명백한 문장 수준의 충돌을 만들지 않은 채 가정, 유도 과정, 인용, 실험 전반에 분포할 수 있다.

저자들은 이 시험에서 문헌 검색 구성 요소를 비활성화했다. 그렇지 않으면 시스템이 원고에서 문제를 발견하는 대신 공개된 철회 공지를 찾아낼 수 있기 때문이다.

MLR은 사례의 16.11%에서 문서화된 철회 사유와 정확히 일치하는 문제를 식별했다. 상당히 유사한 우려를 인정하는 더 유연한 기준에서는 26.07%에 도달했다.

가장 강력한 기준선은 정확 일치에서 9%, 유사 일치에서 18.48%를 기록했다. MLR은 여전히 비교에서 앞섰지만, 합성 벤치마크에서보다 격차는 훨씬 작았다.

철회 논문 데이터세트는 주로 이론 수학과 물리학 연구를 포함한다. 리뷰 시스템은 머신러닝 학회 논문을 중심으로 설계됐기 때문에 직접 비교에는 한계가 있다.

이러한 분야 불일치가 있어도 성능 격차는 핵심 한계를 드러낸다. 의도적으로 심은 모순은 리뷰어에게 찾을 수 있는 명확한 불일치를 제공한다. 실제 결함은 흔히 증명을 재구성하거나, 코드를 다시 실행하거나, 데이터를 확인하거나, 전문 분야 지식을 갖춰야 발견할 수 있다.

벤치마크 저자들은 또 다른 문제도 인정한다. 인간 평가자들은 합성 모순 50개를 검토했고, 이 중 34%가 인접 문장과 자연스러운 흐름을 이루지 못한다는 사실을 발견했다.

명백히 AI가 생성한 것처럼 들린 경우는 8%에 불과했지만, 맥락의 단절은 여전히 탐지 단서가 될 수 있다. 자동 리뷰어는 근본 과학이 왜 틀렸는지 이해하지 못한 채 구절이 어울리지 않는다는 점을 알아차릴 수 있다.

저자들은 이것이 벤치마크를 무효화하는 것이 아니라 더 쉽게 만든다고 주장한다. 삽입된 오류 일부에 탐지 가능한 불규칙성이 있었음에도 기준선 시스템은 여전히 어려움을 겪었다.

이 해석은 타당하지만, 73.43%가 의미하는 바를 바꾼다. 이 수치는 통제된 모순 과제에서의 높은 점수이지, MLR이 제출 논문에서 심각한 오류를 얼마나 자주 찾아내는지에 대한 추정치는 아니다.

네 개의 리뷰를 사용하는 설정도 주목할 만하다. 이 앙상블은 서로 독립적인 네 개의 리뷰 중 어느 하나라도 오류를 언급하면 이를 탐지된 것으로 계산한다.

이는 여러 경고 신호를 수집해 포괄성을 높일 수 있는 저자 측 사전 점검에는 유용하다. 그러나 한 명의 인간 리뷰어를 대체하기 위해 자동 리뷰 하나를 배정하는 상황과는 직접 비교하기 어렵다.

단일 MLR 리뷰의 60.79% 핵심 오류 결과도 여전히 상당하다. 하지만 단일 리뷰 구성에서는 의도적으로 심은 핵심 모순 10개 중 거의 4개가 탐지되지 않았다.

모순이 논문의 주요 주장으로부터 멀어질수록 성능도 하락했다. 이 패턴은 지식 그래프의 심각도 측정을 뒷받침하지만, 세부적인 2차 오류는 여전히 어렵다는 점을 보여준다.

따라서 연구팀의 실용적 활용 사례는 제출 전 감사다. 자동화된 시스템은 가능한 불일치를 표시하고 인간의 주의를 취약한 주장으로 향하게 할 수 있다.

아직 유효성을 인증할 단계는 아니다. 경고를 받지 않은 논문이 정확하다고 가정할 수 없으며, 경고가 정당하다고 가정할 수도 없다.

인간과의 일치는 유용하지만 과학적 검증은 아니다

MLR은 인간 검토 점수와 유사한 판단을 내리지만, 검토자와의 일치는 진실을 찾아내는 일과는 별개다.

ICLR 2025 제출 논문에서 MLR의 점수는 인간 점수와 0.586의 피어슨 상관관계를 보였다. 인간 간 기준치는 0.742였다.

NeurIPS 2024 논문에서는 MLR이 0.451에 도달했으며, 인간 기준치인 0.781과 비교된다. ICML 2025에서는 MLR이 0.429를 기록해 AI Reviewer의 0.439에 근소하게 뒤졌다.

이 수치는 특히 채택 및 거절 논문을 거의 구분하지 못한 시스템과 비교할 때 의미 있는 정렬을 보여준다. 하지만 인간의 결정이나 자동화된 결정이 사실적으로 정확하다는 것을 보여주지는 않는다.

동료 평가는 중요성, 명확성, 참신성에 관한 주관적인 질문을 포함한다. 신중한 두 명의 검토자가 논문이 채택될 만하다는 데 동의하면서도 동일한 기술적 약점을 놓칠 수 있다.

Sakana AI의 분석은 인간과 자동화 시스템이 무엇을 중시하는지에도 차이가 있음을 발견했다. MLR은 타당성과 실험에 더 큰 비중을 두었고, 인간 검토자는 명확성과 참신성에 더 주의를 기울였다.

이러한 차이는 도움이 될 수 있다. 검토자 보조 도구는 인간이 작성할 의견을 단순히 예측할 때보다, 간과된 우려를 드러낼 때 더 큰 가치를 제공한다.

그러나 상호 보완적인 초점은 그 자체로 보정 문제를 만든다. 시스템은 실제 방법론적 약점과 원고의 근거로 뒷받침되지 않는 그럴듯한 비판을 구분해야 한다.

이 연구의 사용자 평가는 이러한 과제를 보여준다. 활동 중인 연구자들은 전체 MLR 워크플로로 38회의 검토 세션을 완료했다.

직접적인 동의 피드백을 받은 378개 의견 가운데 사용자는 81%를 수용했다. 권고 사항은 94%, 강점은 92%의 동의를 받았다.

질문은 79%, 실행 목록 항목은 78%를 기록했다. 약점은 68%로 가장 낮은 동의율을 보였다.

저자는 비판에 대해 중립적인 판단자가 아니므로, 불일치가 반드시 시스템의 오류를 뜻하지는 않는다. 그럼에도 약점은 허위 주장이 가장 큰 피해를 초래할 수 있는 바로 그 지점이다.

수학적 오류나 누락된 실험을 잘못 지적하는 검토자는 편집 결정을 왜곡할 수 있다. 유창한 문장은 그 주장이 근거가 뒷받침하는 수준보다 더 확실해 보이게 만들 수 있다.

인간 검토자도 같은 실수를 할 수 있다. 차이는 자동화가 하나의 잘못된 해석을 수천 건의 제출물에 걸쳐 반복할 수 있다는 점이다.

이 때문에 Sakana AI의 동료 평가 시스템은 의사결정자보다 두 번째 독자로서 더 적합하다. 채택에 대한 최종 권한을 부여하지 않으면서, 인간이 살펴보는 쟁점의 범위를 넓힐 수 있다.

이 시스템의 구조화된 메모는 저자가 복잡한 증거를 관리하는 데에도 도움이 될 수 있다. 이미 검색 가능한 지식 기반을 사용하는 팀은 주장과 실험, 인용, 미해결 질문을 연결하는 유사한 원칙을 적용할 수 있다.

이는 검증을 자동화하지 않는다. 다만 인간이 증거의 흔적을 더 쉽게 검토하도록 만든다.

프롬프트 인젝션이 드러내는 자동화 위험

논문을 이해하는 검토자라도 그 논문 안에 삽입된 텍스트에 조작될 수 있다.

Sakana AI는 원래 대부분 ICLR 2025에 제출됐던 거절 원고 50편의 결론 뒤에 숨겨진 지시를 추가해 명시적인 프롬프트 인젝션을 시험했다.

프롬프트 인젝션은 문서 안의 콘텐츠가 이를 읽는 모델을 지배하는 지시를 덮어쓰려 할 때 발생한다. 악의적인 문구는 자동화된 검토자에게 약점을 무시하거나 높은 점수를 부여하라고 지시할 수 있다.

네 가지 검토 시스템 모두 삽입된 텍스트의 강한 영향을 받았다. 일부 측정 기준에서 MLR은 가장 작은 평균 점수 변화를 보였지만, 결과의 분산은 컸다.

MLR은 50편의 논문 가운데 단 8편에서만 조작을 명시적으로 탐지했다. 나머지 경우에는 삽입된 콘텐츠가 적대적인 것으로 안정적으로 식별되지 않은 채 검토에 영향을 미쳤다.

연구진은 MLR이 이해 우선 워크플로와 멀티모달 입력 덕분에 어느 정도 보호받았을 수 있다고 제안한다. Claude는 문서의 텍스트와 렌더링된 페이지를 모두 확인했지만, 삽입된 지시는 보이는 이미지에는 없었다.

이 불일치는 숨겨진 텍스트가 논문에 속하지 않는다는 가능한 신호를 시스템에 제공했다. 그러나 조작을 일관되게 막기에는 충분하지 않았다.

이 약점이 중요한 이유는 동료 평가가 신뢰할 수 없는 문서를 다루기 때문이다. 저자는 PDF, 소스 파일, 보충 자료, 인용, 때로는 연결된 저장소까지 통제한다.

브라우징이나 코드 실행 도구를 갖춘 자동화 검토자는 더 넓은 공격 표면에 직면한다. 연결된 페이지에는 지시가 포함될 수 있고, 저장소에는 적대적인 댓글이 들어갈 수 있으며, 보충 데이터에는 오해를 유도하는 메타데이터가 숨겨질 수 있다.

학회 정책은 이미 LLM 사용에 공개와 신중한 처리가 필요하다는 점을 인정하고 있다. ICLR reviewer guide는 자동화 보조보다 인간의 책임을 우선시한다.

안전한 배포를 위해서는 문서 콘텐츠를 시스템 지시와 격리해야 한다. 또한 도구를 제한하고, 모델의 행동을 기록하며, 숨겨진 텍스트에 플래그를 지정하고, 중대한 주장에는 인간의 확인을 요구해야 한다.

이런 통제 장치조차 모든 형태의 조작을 해결하지는 못한다. 문구는 명백한 지시를 포함하지 않고도 모델에 영향을 미칠 수 있다.

저자는 비교 대상을 선택적으로 제시하거나, 실패한 실험을 묻어두거나, 자신감 있는 언어를 사용해 주의를 유도할 수 있다. 이러한 기법은 인간 검토자에게도 영향을 미치지만, 자동화 시스템은 예측 가능한 사각지대를 갖게 될 수 있다.

Sakana AI의 이전 작업은 관련된 경고를 제시한다. 2025년 이 회사는 AI가 생성한 워크숍 논문이 채택된 뒤 철회했으며, 생성된 연구에서 인용 오류가 있었다고 설명했다.

외부 연구자들은 이 사례가 자율적인 과학 능력을 보여준 것인지, 아니면 AI 결과물을 효과적으로 인간이 선별한 것인지를 의문시했다. 이후의 peer review analysis는 심사를 통과하는 것과 신뢰할 수 있는 지식에 기여하는 것의 차이를 강조했다.

MLR은 알려진 오류를 바탕으로 검토자를 시험함으로써 이 문제의 일부를 다룬다. 그러나 인젝션 결과는 동일한 모델 계열로 구축된 평가자 역시 전략적으로 작성된 입력에 취약하다는 점을 보여준다.

자동화된 저자와 자동화된 검토자는 결국 서로를 상대로 최적화할 수 있다. 저자는 어떤 언어가 비판을 피하는지 학습할 수 있고, 검토자는 채택된 작업과 유사한 패턴에 보상을 줄 수 있다.

독립적인 검증이 없다면, 이 순환은 과학을 개선하지 않고도 점수만 높일 수 있다.

LLM 동료 평가 벤치마크 이후 주목할 점

세 가지 신호가 Sakana AI의 결과가 유용한 연구 도구가 될지, 인상적인 통제 실험으로 남을지를 결정할 것이다.

첫 번째 신호는 독립적인 재현이다. Sakana AI는 데이터와 코드가 즉시 접근 가능한 공개 저장소가 아니라 요청 시 제공된다고 말한다.

외부 팀은 동일한 논문, 프롬프트, 모델 버전, 판단 절차로 벤치마크를 재현해야 한다. 또한 서로 다른 심사 모델을 시험하고 논쟁이 있는 탐지를 수동으로 감사해야 한다.

재현 연구는 재현율과 함께 거짓 양성도 측정해야 한다. 시스템이 그럴듯하지만 잘못된 비판을 많이 생성한다면, 더 많은 오류를 잡아내는 것의 가치는 제한적이다.

두 번째 신호는 자연 발생 결함에서의 성능이다. 향후 벤치마크에는 검증된 통계적 실수, 뒷받침되지 않는 인과 주장, 인용 실패, 재현 불가능한 결과, 깨진 증명이 포함돼야 한다.

일부 과제는 PDF만이 아니라 코드와 데이터에 대한 접근을 요구할 것이다. 진지한 연구 감사자는 실험을 실행하고, 전처리를 검사하며, 보고된 값을 생성된 출력과 비교해야 할 수 있다.

16.11%의 정확 일치 결과는 출발점을 제공한다. 미래 시스템이 다양하고 독립적으로 선별된 논문에서 이 비율을 높인다면, 실용적 보조 도구라는 근거는 더 강해질 것이다.

세 번째 신호는 학회가 집행 가능한 안전장치를 갖춘 채 이러한 시스템을 배포하는지 여부다. 관련 지표에는 공개 규칙, 개인정보 보호 통제, 프롬프트 인젝션 방어, 문서화된 인간 감독이 포함된다.

검토자에게 비공개 선택형 경고를 제공하는 제한적 시험은 결정을 위임하지 않고도 증강 효과를 시험할 수 있다. 제출물을 자동으로 채점하는 시스템은 훨씬 더 큰 위험을 수반한다.

연구자들은 모델 변화가 Sakana AI MLR 시스템에 어떤 영향을 미치는지도 살펴봐야 한다. 제거 실험은 기반 모델을 교체한 것이 성능 향상의 큰 비중을 차지했음을 보여줬다.

이는 유지보수 압박을 만든다. 한 모델 버전으로 검증된 워크플로는 제공업체가 모델을 업데이트하거나 엔드포인트를 중단한 뒤 다르게 작동할 수 있다.

이는 재현성에 관한 질문도 제기한다. 상업용 모델이 동일한 공개 체크포인트를 보존하지 않은 채 변경되면 과학적 벤치마크의 해석은 더 어려워진다.

따라서 Beyond Imitation의 더 깊은 기여는 방법론적이다. 이 LLM 동료 평가 벤치마크는 생성된 의견이 인간의 의견과 유사한지보다 더 나은 질문을 던진다.

AI 검토자가 논문의 논리를 위협하는 구체적인 문제를 찾아낼 수 있는가?

Sakana AI의 답변은 통제된 조건에서는 고무적이지만, 실제 철회된 작업에서는 냉정하다. 보고된 시험에서 다단계 이해는 분명 피상적인 모방을 앞선다.

자동화된 권한을 부여하기에는 남은 격차가 너무 크다. 실제 논문에는 모순으로 자신을 드러내지 않는 오류가 포함되며, 악의적인 논문은 검토자를 직접 조작할 수 있다.

개발자는 73.43%라는 수치를 명확한 경계를 가진 벤치마크 결과로 다뤄야 한다. 편집자는 자동화 점수를 출판 결정에 포함하기 전에 독립적인 검증을 요구해야 한다.

연구자는 오늘날에도 이 시스템의 핵심 아이디어를 활용할 수 있다. AI 보조 도구에게 모든 주요 주장을 그 증거에 연결하도록 요청하고, 생성된 연결을 검토하며, 뒷받침되지 않는 각 도약을 수동으로 조사하라.

다음 निर्ण정적 결과는 또 다른 합성 기록이 아닐 것이다. 그것은 검토자에게 허위 경보를 쏟아내거나 원고 안에 숨겨진 지시를 따르지 않으면서, 미묘하고 자연 발생적인 오류를 찾아내는 재현된 시스템이 될 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64) 및 M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page