ClaimLens · AI 주장 입증

AI 주장을 그 증거까지 추적하십시오.

Synthetic Nimbus Capital AI는 98%의 콘텐츠 감지 정확도를 광고합니다. 제공된 테스트 기록은 53%입니다. ClaimLens는 검토자가 격차를 점검할 수 있도록 문장, 증거, 결정 규칙을 함께 유지합니다.

6 min 56 sec · 합성 기록 · 캐시된 자문 응답

98% 주장

콘텐츠 감지 정확도

Synthetic Nimbus 웹사이트 단언

53% 기록

제공된 혼합 텍스트 테스트 결과

Synthetic Nimbus 테스트 픽스처

45포인트 격차

구성된 허용 오차 초과

데모 규칙: 5%포인트 초과

법무, 규제 준수(compliance), 마케팅 및 엔지니어링 팀을 위한 제공된 기록 검토입니다. 데모 판정은 법적 준수를 확립하거나 증거를 독립적으로 검증하지 않습니다.

자신감 있는 문장이라도 일치하는 기록이 필요합니다

정확도에 대한 주장은 팀이 특정 업무와 측정된 결과에 대해 약속하는 것입니다. 완전한 자율성에 대한 진술 역시 인간의 개입 여부에 대한 주장을 담고 있습니다. 검토는 표현 이면에 있는 기록과 대조할 수 있을 만큼 이러한 약속들을 온전히 보존해야 합니다.

Nimbus 사례에서 중요한 발견은 광고된 정확도와 제공된 테스트 간의 관계입니다. 검토자는 어떤 문장에 주의를 기울여야 하는지, 그리고 그 이유를 확인할 수 있습니다. 동일한 기록은 또한 다음 질문을 구체화합니다. 문구 표현이 잘못되었는가, 증거가 불완전한가, 아니면 근본적인 테스트에 대한 조사가 필요한가?

검토가 결정에 도달하는 방식

본 데모는 3개의 합성 공개 문서와 14개의 제공된 증거 기록에 대한 한정된 워크플로우를 시연합니다. 10개의 주장을 추출하고, 해당 주체의 대상을 기록에 연결하며, 구성된 각 판정의 사유를 보존합니다.

01 / EXTRACT

문장 보존

결정론적 문장 분할과 AI 키워드 또는 주제 매칭을 통해 번들로 제공된 공개 문서에서 주장을 선별합니다. 원본 문구는 그대로 표시됩니다.

02 / LINK

제공된 뒷받침 근거 찾기

검색(Retrieval)은 구조화된 주제 필드를 테스트 및 운영 기록과 일치시킵니다. 시맨틱 검색을 수행하거나 해당 기록을 인증하지는 않습니다.

03 / DECIDE

규칙 명시

순수 Python 코드가 구성된 검사를 적용합니다. 시연된 지표 예시에서 5%포인트를 초과하는 수치 격차는 CONTRADICTED를 산출합니다.

입증 판사(Substantiation Judge)는 게이트 결정을 변경하지 않고 조언을 제공합니다. 적대적 검토자(Adversarial Examiner)는 게이트에서 입증된 주장을 대상으로 실행되며, REFUTED를 반환할 때 이를 PARTIALLY_SUBSTANTIATED로 하향 조정할 수 있지만 상향 조정할 수는 없습니다. 녹화본은 결정론적 검사가 실행되는 동안 캐시된 자문 응답을 재생합니다. 캐시된 4개의 검토자 응답은 모두 뒷받침된 결과를 유지합니다.

완료된 실행에서는 JSON 입증 패키지(Substantiation Package)를 내보낼 수 있습니다. 후속 조치를 위해 주장, 출처, 판정, 규칙, 근거 및 증거 식별자를 보존하며 요약 및 버전 정보도 포함합니다. 이는 기본 기록을 참조할 뿐 완전한 증거 아카이브를 포함하지는 않습니다.

라벨 이면의 사유 점검

이 화면들은 로컬 ClaimLens 시연에서 가져온 것입니다. 여기에 표시된 모든 Nimbus 회사, 공개 문서, 테스트 및 운영 기록은 가상(합성)입니다.

ClaimLens 콘텐츠 감지 세부 정보: 98% 주장된 정확도, 53% 제공된 테스트 결과 및 CONTRADICTED 정책 결정.
콘텐츠 감지 세부 정보는 원본 문장, 테스트 기록 및 결정 규칙을 보존합니다. 45%포인트 격차는 구성된 5포인트 허용 오차를 초과합니다. 인터페이스의 판례 및 규제 라벨은 예시용이며, 법적 적용 가능성 판단이 아닙니다. 전체 크기 보기

모순은 충돌을 명시합니다

별도의 온보딩 단언은 인간의 개입이 없음(no human in the loop)을 약속합니다. 하지만 합성 운영 로그에는 68%의 인간 개입이 기록되어 있습니다. 구성된 무인(no-human) 규칙은 10% 초과의 개입에 대해 CONTRADICTED를 반환합니다. 해당 임계값은 데모상의 선택이며 법적으로 충분한 기준선은 아닙니다.

격차는 조사 대상으로 열려 있습니다

포트폴리오 모델은 존재하지만, 제공된 로그에는 배분 결정의 1.5%에만 영향을 미친 것으로 기록되어 있습니다. 게이트는 NEEDS_PROOF를 반환합니다. 캐시된 판사는 이를 모순(contradicted)으로 판단하며, 이는 자문 의견과 최종 결과에 서로 다른 라벨이 필요한 이유를 보여줍니다.

1.5% 운영 영향력, NEEDS_PROOF 게이트 및 캐시된 CONTRADICTED 자문을 보여주는 ClaimLens 합성 포트폴리오 주장.
포트폴리오 뷰는 증거 기록의 정확한 1.5% 운영 수치를 보존합니다. 정책 설명문에서는 이를 2%로 반올림하지만, 판정은 NEEDS_PROOF로 유지되는 반면 캐시된 자문 텍스트에는 CONTRADICTED로 표시됩니다. 판례 라벨은 예시용 픽스처 주석이며 법적 판단이 아닙니다. 전체 크기 보기
10개의 합성 주장, 후속 조치가 필요한 6개, 모순된 2개 및 입증된 4개를 보여주는 ClaimLens 등록부(register).
등록부는 뒷받침된 주장을 미해결된 주장과 함께 보관합니다. 구성된 규칙에 따라 4개 주장은 입증(substantiated)되었고, 2개는 모순(contradicted)되었으며, 4개는 증명이 필요(needs proof)합니다. 6개는 후속 조치가 필요하며, 이는 확정된 위반 건수를 의미하지 않습니다. 전체 크기 보기

합성 부정 탐지 주장은 공개된 94% 정밀도 및 이를 뒷받침하는 테스트 및 운영 기록을 통해 입증 상태를 유지합니다. 뒷받침된 픽스처 결과 역시 제공된 기록에 대한 주장일 뿐입니다. 검토자는 실제 문구에 의존하기 전에 실제 측정값과 그 타당성을 검증해야 합니다.

공개된 94% 정밀도, 테스트 및 운영 기록, SUBSTANTIATED 판정을 보여주는 ClaimLens 합성 부정 탐지 주장.
뒷받침된 부정 탐지 예시는 테스트 및 운영 참조를 모두 보존합니다. 픽스처 테스트 설명문에는 94.1%로 표시되어 있으나 저장된 숫자 필드는 94.0입니다. 공개된 주장은 94%입니다. 이는 구성된 규칙에 따른 뒷받침일 뿐 독립적으로 검증된 성능이 아닙니다. 전체 크기 보기

이 워크플로우의 적용 영역

ClaimLens는 주장 대 기록(claim-to-record) 검토를 시연합니다. 아래 표는 기록된 워크플로우를 통해 점검할 수 있는 항목과 실제 검토에서 여전히 요구되는 작업을 구분합니다.

검토 과업본 시연이 제공하는 것본 시연 범위 외로 남는 것
약속된 내용 확인제공된 출처에 연결된 문장일반 문서 수집 및 완전한 주장 발견
뒷받침 근거 대조주제 기반 기록 연결 및 구성된 검사증거 인증 및 독립적인 테스트 평가
결과 이해판정, 결정 규칙 및 근거법률 자문 또는 규제 기관 승인
검토 결과 인계증거 식별자가 포함된 JSON 패키지완전한 증거 아카이브 또는 변조 방지 보관 연속성(tamper-evident custody)

본 데모가 수행하지 않는 작업

본 데모는 번들로 제공된 합성 데이터를 사용하는 로컬 시연입니다. 실시간 웹사이트나 공시 크롤러, 임의의 문서 업로드, 프로덕션 AIBOM 또는 CI/CD 연동, 시맨틱 검색, 자율적인 법적 평가 또는 HTML 바인더 내보내기를 포함하지 않습니다. 데모의 임계값은 통계적 신뢰도나 법적 충분성을 확립하지 않습니다. 본 페이지는 기록된 워크플로우를 설명하며, 로컬 애플리케이션에 대한 접근 권한을 제공하지는 않습니다.

검토 팀이 물어야 할 질문들

이 도구가 당사의 AI 주장이 법적으로 준수되는지 알려줄 수 있습니까?

ClaimLens는 구성된 데모 규칙을 사용하여 제공된 문구와 기술 기록을 비교합니다. 입증(substantiated) 결과가 법적 면책을 의미하는 것은 아니며, 인터페이스에 표시된 규제 라벨은 예시용 라우팅 라벨입니다. 사람에 의한 검토 및 기본 기록에 대한 검증은 여전히 필수적입니다.

자체 문서를 업로드하거나 웹사이트를 연결할 수 있습니까?

본 시연은 번들로 제공된 합성 Nimbus 데이터셋을 사용합니다. 임의의 문서 업로드를 허용하지 않으며 웹사이트, 공시 서류 또는 내부 시스템을 크롤링하지 않습니다. 본 페이지는 기록된 워크플로우와 그 증거 화면을 보여줍니다.

검토 과정에서 실제로 어떤 증거를 확인합니까?

데모는 구조화된 주제 필드를 통해 추출된 문장을 제공된 기술 기록과 연결합니다. 이러한 기록에는 테스트 및 운영 로그가 포함됩니다. 검사는 구성된 값과 조건을 대조할 뿐 기록을 인증하거나 테스트 방법론을 독립적으로 평가하지는 않습니다.

AI가 최종 결정을 내립니까?

입증 판사(Substantiation Judge)는 정책 게이트 결정을 변경하지 않고 조언을 제공합니다. 적대적 검토자(Adversarial Examiner)는 반박을 반환할 때 게이트에서 입증된 주장을 하향 조정할 수 있지만 주장을 상향 조정할 수는 없습니다. 본 녹화본에서 자문 응답은 캐시되어 있으며 4개의 검토자 응답은 모두 뒷받침된 결과를 유지합니다.

모델이 존재하는데도 왜 주장에 증명이 필요할 수 있습니까?

모델 기록은 해당 구성 요소가 문서화되어 있음을 입증하지만, 운영상의 주장에는 실제로 어떤 동작을 수행하는지에 대한 증거도 필요합니다. 합성 포트폴리오 예시에서 제공된 로그는 배분 결정의 1.5%에만 영향을 미친 것으로 기록되어 있습니다. 구성된 게이트는 NEEDS_PROOF를 반환하여 검토를 위해 해당 격차를 보존합니다.

내보낸 패키지에서 검토자는 무엇을 받게 됩니까?

브라우저의 Export 버튼은 각 주장, 출처, 판정, 결정 규칙, 근거 및 증거 식별자가 포함된 완료된 실행의 JSON 패키지를 저장합니다. 또한 요약, 엔진 버전 및 생성 타임스탬프를 포함합니다. 완전한 증거 기록, 자문 녹취록 또는 변조 방지 보관 연속성은 포함하지 않습니다.

기술 연구

본 시연에 대한 더 넓은 맥락을 파악하기 위해 관련 연구를 살펴보십시오.

주장과 그 증거를 동일한 검토의 장으로 가져오십시오

Veriprajna와 함께 주장 입증 워크플로우를 논의하십시오.

구현을 정의하기 전에 귀사 팀에 필요한 기록, 검토 경계 및 사람의 의사결정에 대해 논의할 수 있습니다.

검토 범위 설정

  • ✓ 검토 대상 문구 식별
  • ✓ 제공된 증거 매핑
  • ✓ 미해결 질문 명시
  • ✓ 사람 검토 책임 합의

구현 정의

  • ✓ 출처 및 기록 수집 논의
  • ✓ 적절한 규칙 경계 정의
  • ✓ 검토자 대상 설명 계획
  • ✓ 증거 인계 요건 명시