top of page

Claude가 ADHD 생각을 더 잘 정리하며 Anthropic과 Google의 경쟁이 개인적인 문제로 번지다

Anthropic은 한 작가의 ADHD 생각 정리라는 복잡하고 지극히 개인적인 과제를 중심으로 한 4개 챗봇 비교에서 Google, OpenAI, Microsoft를 앞섰다.

원문 비교는 정돈된 문단으로 떠오르지 않는 생각들에 질서를 부여해 달라고 ChatGPT, Gemini, Claude, Copilot에 요청했다. 보도에 따르면 Claude는 작성자가 가장 유용하다고 느낀 답변을 내놓았다.

이 결과가 보편적인 순위를 증명하는 것은 아니다. 한 사람, 한 가지 유형의 과제, 그리고 무엇이 감당 가능하게 느껴졌는지에 대한 주관적 판단에서 나온 결과다. 그럼에도 이 시험은 Anthropic과 Google의 경쟁에서 중요한 균열선을 드러낸다.

가장 도움이 된 어시스턴트가 반드시 기능 목록이 가장 넓거나 벤치마크 점수가 가장 높은 것은 아니었다. 답변을 이해하고 실행하는 데 필요한 작업을 가장 많이 줄여 준 어시스턴트였다.

ADHD를 가진 사람들에게 이 차이는 중요하다. 이 질환은 주의력, 계획, 작업 기억, 과제 관리에 영향을 줄 수 있지만 경험은 매우 다양하다. 미국 국립정신건강연구소의 임상 개요 역시 진단과 치료는 자격을 갖춘 전문가의 영역이라고 강조한다.

AI 어시스턴트는 그러한 치료를 제공할 수 없다. 다만 사용자가 이미 말하고 싶은 내용을 알고 있지만 이를 쉽게 활용 가능한 순서로 바꾸지 못할 때, 정보를 재구성하는 데 도움을 줄 수 있다.

이처럼 제한적인 사용 사례는 이번 챗봇 비교에 또 하나의 인위적 리더보드보다 더 큰 의미를 부여한다. 이는 어시스턴트가 인지적 혼란을 또 다른 혼란의 층을 만들지 않고 외부 구조로 전환할 수 있는지를 시험한다.

Claude는 대부분의 AI 벤치마크가 무시하는 시험에서 이겼다

의미 있는 변화는 새 모델의 출시가 아니었다. 네 가지 주요 어시스턴트가 정리되지 않은 사고를 더 쉽게 활용할 수 있게 만드는지에 대한 시험이었다.

전통적인 AI 평가는 측정 가능한 답이 있는 질문에 초점을 맞춘다. 연구자들은 코딩 과제, 수학 문제, 사실 정확성, 지연 시간, 지시 이행을 점수화할 수 있다. 개인의 생각을 쏟아낸 내용을 정리하는 일에는 단 하나의 정답이 없다.

따라서 작성자의 판단은 실용적인 특성에 달려 있었다. 답변은 우선순위를 파악했는가? 작성자의 의미를 보존했는가? 길을 잃지 않고 훑어볼 수 있었는가? 설득력 있는 다음 행동을 만들었는가?

이 질문들은 콘텐츠가 그룹화되고, 이름 붙여지고, 순서화되는 방식을 뜻하는 정보 아키텍처를 시험한다. 또한 어시스턴트가 해석의 부담을 얼마나 사용자에게 되돌려 주는지도 시험한다.

답변은 기술적으로 유능하면서도 사용하기 어려울 수 있다. 긴 분류 체계를 만들고, 모든 세부 사항을 반복하며, 동기 부여 문구를 추가하고, 여러 계획 시스템을 제안할 수 있다. 각각의 추가 요소는 따로 보면 도움이 되는 듯하다.

그러나 이런 요소들이 함께 쌓이면 한 번에 붙들고 처리해야 하는 정보량인 인지 부하를 높일 수 있다. 그러면 사용자는 어시스턴트가 만든 정리를 다시 정리해야 한다.

보도된 Claude의 승리는 이번 사례에서 더 나은 균형을 찾았음을 시사한다. 그 답변은 작성자의 사고방식에 더 잘 맞고 외부 구조로서 더 유용하게 느껴졌던 것으로 보인다. 이는 단순히 매끄러운 요약문을 생성하는 것과는 다르다.

이 차이는 ADHD 관련 워크플로의 핵심이다. 중요한 맥락을 제거한다면 간결한 답변도 실패할 수 있다. 너무 많은 범주, 선택지 또는 준비 단계를 제시한다면 포괄적인 답변 역시 실패할 수 있다.

가장 좋은 결과는 중요한 내용을 보존하면서 시작하는 데 필요한 결정의 수를 줄인다. 빽빽한 생각의 나열을 우선순위, 미해결 질문, 다음 행동처럼 이해 가능한 작은 항목 집합으로 바꿔야 한다.

이 때문에 이번 비교를 “Claude가 가장 똑똑하다”로 축소해서는 안 된다. 이 시험은 일반 지능, 임상적 효과, 장기 생산성을 측정하지 않았다. 한 어시스턴트의 출력 방식과 한 사람의 즉각적인 인지적 필요 사이의 적합성을 측정했다.

그 적합성은 여전히 가치 있는 증거다. 소비자 AI 채택은 벤치마크 차트만으로가 아니라 이런 순간들이 반복되며 이뤄진다.

모델은 누군가가 미완성의 자료를 맡길 때 유용해진다. 그 자료에는 부분적인 아이디어, 중복된 걱정, 감정적 맥락, 상충하는 마감일, 뚜렷한 범주가 없는 과제가 포함될 수 있다.

어시스턴트는 불확실성이 사라진 척하지 않으면서 구조를 추론해야 한다. 질서를 너무 강하게 부여하면 사용자의 의도를 왜곡할 수 있다. 너무 적게 부여하면 사용자에게는 의미 있는 부담 경감이 없다.

보도에 따르면 Claude는 시험 중 이 경계를 더 잘 다뤘다. 이 결과는 정리가 틈새 글쓰기 기능이 아니라 핵심 인터페이스 문제가 되고 있음을 보여 주며 모든 경쟁사에 압박을 가한다.

Anthropic과 Google의 경쟁은 이제 인지적 마찰에 달려 있다

Anthropic과 Google의 경쟁은 답변을 받은 뒤 사용자가 가장 적은 수정 작업만 하게 하는 어시스턴트가 누구인지에 점점 더 좌우되고 있다.

Google은 계정, 지역, 설정, 제품 구성에 따라 Gemini를 방대한 서비스와 개인 정보 모음에 연결할 수 있다. 이러한 범위는 문서, 메시지, 캘린더, 기타 저장된 맥락과 관련된 과제에서 Gemini에 분명한 이점을 제공한다.

Anthropic은 Claude로 다른 입장을 취한다. 이 제품의 정체성은 신중한 글쓰기, 확장된 분석, 상당한 양의 맥락 처리에 자주 초점을 맞춰 왔다. 구조화되지 않은 생각의 나열에서는 이런 특성이 다른 애플리케이션에 접근할 수 있는 능력보다 더 중요할 수 있다.

따라서 이번 비교는 통합의 폭과 상호작용 품질 사이의 경쟁을 드러낸다. 통합은 어시스턴트가 자료를 가져오는 데 도움이 된다. 하지만 최종 답변이 쉽게 처리될 것까지 보장하지는 않는다.

단편적인 생각이 스무 개 있는 사용자가 항상 더 많은 맥락을 필요로 하는 것은 아니다. 더 날카로운 선별, 더 명확한 그룹화, 더 적은 경쟁 제안이 필요할 수 있다.

Google은 여전히 강력한 전략적 위치에 있다. Gemini는 이미 Google 제품 전반에서 이뤄지는 워크플로에 참여할 수 있다. 관련 정보가 해당 서비스 안에 있을 때 복사, 전환, 수동 검색을 줄일 수 있다.

그러나 검색과 불러오기는 과제의 절반에 불과하다. 어시스턴트는 무엇이 주목받을 가치가 있는지 결정하고 사용자가 실행할 수 있는 형태로 제시해야 한다.

여기서 인지적 마찰은 경쟁 지표가 된다. 인지적 마찰은 불명확한 레이블, 과도한 선택지, 반복되는 결정, 대대적인 편집이 필요한 출력 등 인터페이스가 만들어 내는 정신적 노력이다.

챗봇은 종종 유창한 문장 뒤에 이런 마찰을 숨긴다. 완전한 문장과 깔끔한 서식을 사용하기 때문에 답변은 완성된 것처럼 보인다. 하지만 사용자는 여전히 무엇이 중요한지 가려내고, 반복을 제거하고, 광범위한 조언을 구체적인 행동으로 옮겨야 할 수 있다.

ADHD 사용자에게 이런 수정 작업은 본래의 목적을 무력화할 수 있다. 주의를 조절하고 목표 지향적 활동을 완수하는 데 관여하는 정신 과정인 실행 기능은, 지나치게 많은 동등한 비중의 경로를 제시하는 답변으로 부담을 받을 수 있다.

올바른 출력이 언제나 가장 짧은 출력은 아니다. 이해 가능한 위계를 갖춘 답변이다.

유용한 위계는 사용자의 즉각적인 목표로 시작해, 다음 물리적 행동과 이를 뒷받침하는 메모로 이어질 수 있다. 우선순위가 낮은 아이디어는 첫 단계와 경쟁하지 않으면서도 계속 보이게 둘 수 있다.

이 구조는 ADHD가 없는 사람들에게도 도움이 된다. 관리자, 연구자, 학생, 개발자는 한 번에 평가할 수 있는 양보다 더 많은 정보를 정기적으로 수집한다.

따라서 더 넓은 시장 기회도 상당하다. 단편적인 입력을 신뢰할 수 있는 계획으로 꾸준히 전환하는 챗봇은 단순한 질의응답 시스템을 넘어선다. 사고와 행동 사이의 인터페이스가 된다.

Google의 위험은 Stuff의 한 작성자가 Claude를 선호했다는 데 있지 않다. Gemini가 더 폭넓게 자신의 정보에 접근할 수 있더라도, 사용자가 Claude를 마찰이 적은 사고 과제와 연관 지을 수 있다는 점이다.

Anthropic의 위험은 그 반대다. 뛰어난 출력 설계는 고립된 프롬프트에서는 승리할 수 있지만, 통합된 경쟁사들은 유통 우위를 유지한 채 그로부터 배울 수 있다.

OpenAI와 Microsoft도 같은 압박을 받고 있다. ChatGPT는 폭넓은 소비자 인지도와 점점 강화되는 지속적 개인화 기능을 갖고 있다. Microsoft는 Copilot을 업무 문서와 커뮤니케이션 가까이에 배치할 수 있다.

이런 이점 어느 것도 답변 설계를 자동으로 해결하지는 않는다. 익숙한 애플리케이션 안에 나타나더라도 복잡한 답변은 여전히 복잡하다.

경쟁의 다음 단계는 어시스턴트가 무엇을 아는지뿐 아니라 특정한 사람과 순간을 위해 그것을 어떻게 포장하는지도 조정할 때 보상할 것이다.

Claude 대 Gemini는 사실상 구조 대 기능 폭의 대결이었다

Claude와 Gemini의 대결은 단순한 모델 경쟁이 아니었다. 구조가 더 넓은 제품 범위를 능가할 수 있는지에 대한 실용적인 시험이었다.

AI 기업들은 개인화를 선호도를 기억하거나 관련 파일에 접근하는 것으로 자주 설명한다. 이런 기능은 연속성을 개선할 수 있지만, 어시스턴트가 사용자가 선호하는 세부 수준을 이해한다고 보장하지는 않는다.

누군가는 조사할 때는 포괄적인 답변을 원하면서도 부담을 느낄 때는 세 줄짜리 체크리스트를 원할 수 있다. 지속적인 프로필만으로는 매 순간 어떤 모드가 적절한지 완전히 판단할 수 없다.

어시스턴트는 현재 요청 안의 신호를 감지해야 한다. 길고 무질서한 입력은 사용자가 압축을 원한다는 뜻일 수 있다. 하지만 모든 세부 사항이 중요하게 느껴져 추적 가능하게 남아 있어야 한다는 뜻일 수도 있다.

좋은 답변은 점진적 공개를 통해 두 필요를 모두 충족할 수 있다. 이 설계는 핵심 정보를 먼저 제시하고, 그 아래에서 뒷받침하는 세부 사항을 확인할 수 있게 한다.

예를 들어 어시스턴트는 핵심 문제를 설명하는 한 문장으로 시작할 수 있다. 이어 세 가지 우선순위를 제시하고 각각에 하나의 다음 행동을 배정한 뒤, 해결되지 않은 자료는 별도의 보류 섹션에 둘 수 있다.

위계는 장식적인 서식보다 더 중요하다. 모든 제목이 똑같이 중요해 보인다면 제목 열 개는 긴 문단만큼이나 큰 마찰을 만들 수 있다.

보도된 Claude의 이점은 독립적으로 측정된 능력 차이보다는 답변이 작성자에게 어떻게 느껴졌는지에서 비롯됐을 가능성이 크다. 이 주관적 차원을 무시해서는 안 된다. 사용성은 언제나 사람이 경험하는 것이다.

하지만 이것은 보편적인 결론도 막는다. 다른 사용자는 Gemini의 정리 방식, ChatGPT의 대화 스타일, 또는 Copilot의 업무 환경 연결을 더 선호할 수 있다.

프롬프트 표현도 결과를 바꿀 수 있다. “이 생각들을 정리해 줘”는 해석의 여지를 상당히 남긴다. 모델은 요약, 분류, 우선순위화, 일정 작성, 또는 추가 질문을 할 수 있다.

이들은 서로 다른 과제다. 원하는 변환을 추측해 맞히는 어시스턴트는 이점을 얻지만, 사용자의 의도가 바뀌면 그 추측은 실패할 수 있다.

이는 네 기업 모두에 설계 과제를 안긴다. 여러 추가 질문을 하면 정확도를 높일 수 있지만, 사용자가 도움을 받기 전에 또 하나의 장벽을 만든다.

가장 강력한 상호작용은 가정을 드러내면서 즉각적인 초안을 제공할 수 있다. 예를 들어 자료를 긴급도별로 그룹화했다고 밝힌 뒤, 사용자가 주제별 또는 시간순 보기로 전환하도록 초대할 수 있다.

이 접근 방식은 추진력을 유지한다. 또한 초기에 설정 과정을 강요하지 않으면서 사용자에게 통제권을 제공한다.

OpenAI의 메모리 기능은 이 문제의 또 다른 측면을 보여준다. 회사의 메모리 제어 기능을 통해 사용자는 ChatGPT가 대화 전반에 걸쳐 특정 세부 정보를 유지할지 관리할 수 있다. 지속적 맥락은 반복 설명을 줄일 수 있지만, 사용자는 여전히 시스템이 무엇을 기억하는지 확인할 수 있어야 한다.

Gemini가 연결된 정보를 사용할 때 Google도 비슷한 신뢰 문제에 직면한다. Google의 개인정보 보호 안내는 활동, 사람의 검토, 연결된 서비스가 사용자 설정과 어떻게 상호작용하는지 설명한다.

이러한 제어 기능이 중요한 이유는 개인적인 생각을 쏟아낸 내용이 일반적인 검색어보다 더 민감한 정보를 담을 수 있기 때문이다. 사용자는 건강 문제, 직장 갈등, 가족 관련 세부 사항, 미완성 아이디어 또는 다른 사람의 이름을 포함할 수 있다.

따라서 조직화 지원 도구는 사용자가 매우 개인적인 자료를 공유하기 전에 개인정보 보호 경계를 이해하기 쉽게 제시해야 한다. 또한 삭제, 임시 세션, 저장된 메모리와 일회성 맥락의 명확한 분리도 지원해야 한다.

직장에서는 Microsoft가 또 다른 고려 사항을 더한다. Copilot의 응답은 회사 파일, 메시지, 정책과 가까운 영역에서 작동할 수 있다. 이런 맥락은 관련성을 높일 수 있지만, 권한, 보존, 그리고 개인적 성찰이 고용주가 관리하는 계정 안에 있어야 하는지에 대한 질문도 제기한다.

성공하는 제품에는 좋은 문장력 이상이 필요하다. 유용한 구조, 적절한 맥락, 낮은 상호작용 비용, 이해하기 쉬운 데이터 제어 기능을 결합해야 한다.

Stuff 비교에서 Claude가 낸 결과는 Anthropic에 유리한 사례를 제공한다. 그러나 그 우위가 계정, 프롬프트, 모델 버전, 언어 또는 더 긴 워크플로 전반에서 지속되는지는 아직 확정되지 않았다.

한 작성자의 성공은 임상적 증거가 아니다

유용한 챗봇 결과는 AI가 ADHD를 치료하거나 전문적 지원을 대체한다는 증거가 아니라, 워크플로 관찰로 다뤄야 한다.

ADHD는 다양한 양상과 기능 저하 수준을 보이는 임상 질환이다. 개인적 경험담은 한 사람이 무엇을 유용하게 느꼈는지 보여줄 수 있지만, 더 넓은 집단에 대한 효과를 입증할 수는 없다.

Stuff 비교는 통제된 연구로 보이지 않는다. 대표성 있는 참가자 집단, 눈가림 평가, 고정된 채점 체계, 서로 다른 과제 유형에 걸친 반복 실험이 부족하다.

모델의 행동도 바뀔 수 있다. 공급업체는 시스템 지침, 안전 정책, 인터페이스, 기반 모델을 업데이트한다. 한 세션에서 관찰된 결과가 나중에 재현되지 않을 수 있다.

같은 제품 안에서도 응답 품질은 계정 설정, 대화 기록, 활성화된 도구, 입력 문구의 정확한 표현에 따라 달라질 수 있다. 공정한 비교라면 이런 변수를 통제해야 한다.

또한 답변을 보기 전에 성공의 기준을 정의해야 한다. 그렇지 않으면 평가자는 자신에게 가장 익숙하게 느껴지는 스타일을 무의식적으로 선호할 수 있다.

가능한 기준으로는 원래 생각에 대한 충실도, 중복 아이디어 감소, 우선순위의 명확성, 실행 가능한 다음 단계의 수, 읽는 데 드는 노력, 그리고 사용자가 나중에 계획을 기억할 수 있는 능력 등이 있다.

더 강력한 연구는 정리된 결과물이 행동을 바꾸는지 검증할 것이다. 참가자는 의도한 일을 시작했는가? 계획은 다음 날에도 유용했는가? 놓친 약속을 줄였는가, 아니면 몇 분간 안심되는 느낌만 주었는가?

이 차이는 중요하다. 챗봇은 완료된 것처럼 보이게 만드는 데 매우 능숙하기 때문이다. 아름답게 서식화된 계획은 후속 실행을 개선하지 못한 채 잠시 통제감을 줄 수 있다.

AI는 개인 정보를 재구성하는 과정에서 오류를 도입할 수도 있다. 서로 다른 우려를 하나로 합치거나, 사용자가 표현하지 않은 긴급성을 부여하거나, 사소해 보이지만 정서적으로 중요한 세부 사항을 누락할 수 있다.

사용자는 의료, 금융, 고용 또는 법적 결정에 결과물을 의존하기 전에 이를 검토해야 한다. 또한 자신감 있는 표현을 도우미가 모든 함의를 이해했다는 증거로 받아들여서는 안 된다.

가장 안전한 틀은 보조 수단이라는 관점이다. 챗봇은 사용자의 생각을 수정 가능한 외부 표현으로 제공한다. 그 표현이 정확하고 적절한지 판단할 책임은 사용자에게 남는다.

이 원칙은 생산성 조언에도 적용된다. 모델은 시간 블로킹, 알림, 우선순위 매트릭스 또는 업무를 더 작은 과제로 나누는 방식을 제안할 수 있다. 이런 접근법은 어떤 사람에게는 도움이 되지만, 다른 사람에게는 좌절감을 줄 수 있다.

제안된 시스템을 반복해서 실패했다고 해서 개인의 실패로 해석해서는 안 된다. 그 시스템이 사용자의 필요, 환경 또는 현재의 여력에 맞지 않는다는 뜻일 수 있다.

의존성의 위험도 있다. 사용자가 모든 우선순위 판단을 외주화하면, AI 처리 과정을 한 번 더 거치지 않고는 진행하기를 꺼릴 수 있다.

더 나은 설계 목표는 조절 가능한 지원이다. 때로는 도우미가 완전한 구조를 만들어야 한다. 다른 때에는 하나의 다음 행동을 식별한 뒤 물러나야 한다.

AI 공급업체들은 아직 이러한 형태의 지원을 측정하는 표준 방식을 확립하지 못했다. 참여도 지표는 오히려 잘못된 행동에 보상할 수도 있다. 더 긴 대화와 반복 프롬프트는 플랫폼에는 긍정적으로 보일 수 있지만, 사용자에게는 추가적인 마찰을 의미할 수 있다.

개인정보 보호는 또 다른 제약 조건으로 남는다. 매우 개인적인 생각의 기록에는 증상, 진단, 관계, 직장 내 우려가 드러날 수 있다. 사용자는 이런 자료를 공유하기 전에 적용되는 데이터 설정을 확인해야 한다.

또한 소비자 계정과 고용주가 관리하는 서비스를 구분해야 한다. 조직 정책은 보존 기간, 관리자 접근 권한, 허용된 사용 방식에 영향을 줄 수 있다.

이런 주의점들이 작성자의 결과를 무효화하는 것은 아니다. 다만 그 결과의 적절한 범위를 규정한다.

Claude는 특정 사용성 상황에서 이겼다고 전해진다. 이는 개인 경험으로서는 신뢰할 수 있고 제품 신호로서도 유용하다. 치료적 효용이나 광범위한 모델 우위를 입증하는 것은 아니다.

Anthropic, Google, OpenAI, Microsoft가 다음으로 입증해야 할 것

다음 승자는 한 번 성공한 정리 프롬프트를 반복 가능하고 제어 가능한 워크플로로 바꾸는 도우미가 될 것이다.

먼저 지켜볼 신호는 다양한 생각 기록에서의 재현성이다. 같은 도우미가 짧은 목록, 긴 감정적 서술, 회의 조각, 경쟁하는 마감일, 며칠에 걸쳐 수집한 메모를 모두 처리해야 한다.

일관된 성능은 Claude가 지속적인 조직화 우위를 가진다는 주장을 강화할 것이다. 프롬프트에 따라 큰 편차가 난다면 Stuff의 결과는 한 번의 유리한 상호작용에 크게 의존했음을 시사할 것이다.

재현성에는 충실도도 포함돼야 한다. 모델은 가독성을 높이기 위해 사용자의 의미를 조용히 바꿔서는 안 된다. 불확실성을 보존하고, 약속과 아이디어를 구분하며, 우선순위를 추론한 지점을 보여줘야 한다.

두 번째 신호는 적응형 출력 제어다. 사용자는 더 적은 세부 정보, 더 많은 맥락, 다른 방식의 그룹화 또는 하나의 즉각적인 행동을 쉽게 요청할 수 있어야 한다.

이를 위해 프롬프트 전문성이 필요해서는 안 된다. 인터페이스 제어 기능은 “다음 단계만 표시”, “모든 세부 정보 유지”, “긴급도별 그룹화” 같은 선택지를 제공할 수 있다.

Anthropic이 유리한 출력 스타일을 이해하기 쉬운 제어 기능으로 전환한다면 Claude의 입지를 강화할 수 있다. Google이 Gemini의 연결된 맥락을 둘러싸고 똑같이 효과적인 제어 기능을 추가한다면, 그 배포 우위는 더욱 중요해질 것이다.

OpenAI는 단순히 내용뿐 아니라 답변 구조를 바꾸는 개인화를 통해 대응할 수 있다. Microsoft는 관련된 직장 자료의 유형에 맞춰 조직화 방식을 조정함으로써 Copilot을 더 유용하게 만들 수 있다.

세 번째 신호는 지속 가능한 워크플로 통합이다. 잘 정리된 답변도 사용자가 잊어버리는 또 하나의 고립된 채팅이 된다면 가치는 제한적이다.

사용자는 선택한 행동을 캘린더, 작업 시스템, 문서 또는 검색 가능한 개인 지식 베이스로 옮길 수 있어야 한다. 도우미가 원치 않는 작업을 만들거나 민감한 자료를 자동으로 보존하지 않도록, 전송은 신중하게 이뤄져야 한다.

여기서 최고의 AI 정리 도구는 연속성과 제어 사이의 균형을 맞춰야 한다. 사용자가 기억되기를 원하는 것은 기억하고, 임시로 남아야 하는 것은 버리며, 그 차이를 설명해야 한다.

유용한 워크플로는 필터링되지 않은 생각 기록에서 시작할 수 있다. 도우미는 간결한 지도를 반환하고, 사용자가 분류를 승인하게 한 다음, 승인된 구조만 저장한다.

이 과정은 사적인 표현과 지속적인 지식 사이에 감사 지점을 만든다. 또한 잘못된 해석이 다른 시스템으로 퍼질 가능성도 낮춘다.

이미 개인 지식 베이스를 구축하는 사람들도 같은 과제에 직면한다. 정보를 수집하는 일은 쉽다. 이를 검색 가능하고 실행 가능한 것으로 바꾸려면 사용자의 원래 의도를 여전히 반영하는 구조가 필요하다.

따라서 Anthropic과 Google의 경쟁은 모델 답변을 넘어 확장될 것이다. 메모리, 권한, 통합, 편집 도구, 대화와 행동 사이의 전환 품질이 포함될 것이다.

공급업체들은 주관적 지원을 위한 더 명확한 평가 방법도 공개해야 한다. 유용한 벤치마크는 과제 완료, 사용자가 평가한 정신적 노력, 사실적 충실도, 필요한 수정 횟수를 결합할 수 있다.

이러한 테스트에는 신경다양성 참가자를 하나의 획일적인 집단으로 취급하지 않고 포함해야 한다. 또한 서로 다른 인터페이스 패턴이 스트레스나 시간 압박 수준에 따라 더 잘 작동하는지도 살펴봐야 한다.

현재로서는 독자가 직접 신중한 비교를 실행할 수 있다. 동일하게 익명화한 입력을 사용하고, 새 세션에서 시작하며, 불필요한 개인화를 비활성화하고, 답변을 읽기 전에 채점 기준을 정하라.

각 도우미가 의미를 보존했는지, 신뢰할 만한 첫 단계를 제시했는지, 결정해야 할 사항을 줄였는지 판단하라. 길이나 시각적 완성도에 자동으로 점수를 주지 마라.

그런 다음 다른 유형의 생각 기록으로 테스트를 반복하라. 한 번의 승리는 흥미롭다. 일관된 패턴은 제품 선택의 지침이 될 수 있는 증거다.

Stuff 작성자의 결과는 이 좁은 시나리오에서 Claude에 초기 우위를 준다. 또한 모든 경쟁사에 명확한 목표를 제시한다. 사용자의 미완성 생각과 가능하다고 느껴지는 첫 행동 사이의 거리를 줄이는 것이다.

다음에 메모가 구분되지 않는 덩어리가 되면, 그 거리를 기준으로 도우미들을 시험해 보라. 민감한 세부 사항은 제거하고, 동일한 입력을 사용하며, 각 도구에 하나의 우선순위, 세 가지 다음 행동, 그리고 별도의 보류 공간을 요청하라. 행동에 옮기기 전에 가장 적은 수정이 필요한 출력은 무엇인가? 이 질문은 어느 모델이 가장 똑똑하게 들리는지를 묻는 것보다 더 유용하다. 또한 Anthropic과 Google의 경쟁이 일반 사용자에게 점점 더 무엇을 의미하는지도 포착한다. 승리하는 도우미는 단지 가장 유창한 응답을 만들지 않을 것이다. 사람들의 판단력, 개인정보 보호, 통제권을 지키면서 방향감을 되찾도록 도울 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

​머릿속에 검색창을 추가하세요

remio에게 물어보기만 하면 됩니다

모든 것을 기억하세요

정리는 필요 없습니다

bottom of page