합성 조달 사례를 통해 거래 이력과 매출이 적격성에 미치는 영향과 반사실적 분석이 낙찰 승인 없이 검토를 이끄는 이유를 살펴봅니다.
조달인공지능Responsible AI

조달 AI가 공급업체를 배제하기 전, 가정을 철저히 검토하라

Ashutosh SinghalAshutosh Singhal2026년 7월 31일7 min

조달 팀에는 구매 관점에서 타당하게 방어할 수 있는 공급업체 배제 사유가 필요합니다. 최종 후보 기준점 미만의 점수는 하나의 결과를 보여줄 뿐입니다. 그것만으로는 해당 공급업체의 실제 성과가 미흡한지, 입증 데이터가 부족한지, 혹은 팀이 의도한 방식으로 계산식이 오랜 거래 이력을 우대하고 있는지 설명되지 않습니다.

안내: 본 문서는 생성형 AI를 활용하여 작성되었습니다.

저는 바로 이러한 구분을 중심으로 MeritLens를 구축했습니다. 저의 입장은 거래 이력과 매출 가정에 민감한 배제 결정은 시뮬레이션된 자율 낙찰이 진행되기 전에 검증 가능한 설명을 갖추어야 한다는 것입니다. 이러한 가정을 변경하면 기존 결정과 그 근거를 보존하면서도 재검토를 위한 결정을 드러낼 수 있어야 합니다. 또한 그 설명은 구매자가 리스크에 대한 우려가 정당하다고 판단할 수 있는 여지도 남겨두어야 합니다.

우수한 납기 성과는 배제 결정과 공존할 수 있습니다

저희 데모에 포함된 합성 산업용 파스너 조달 사례를 살펴보겠습니다. Bridgepoint Components의 정시 납기율은 98.1%이며, Apex Fastener Industries는 97.2%입니다. Bridgepoint는 품질 합격률에서도 소폭 앞서 있습니다. 그럼에도 시뮬레이션 플랫폼은 Bridgepoint에 70.9점, Apex에 91.9점을 부여합니다. 최종 후보 기준 하한선이 80점이므로 Bridgepoint는 배제됩니다.

이 공식은 납기, 품질, 재무, 가격 요인에 동일한 가중치를 부여합니다. 납기와 품질은 뒷받침되는 거래 이력의 양에 따라 조정됩니다. 즉, 거래 건수와 감사 횟수가 측정된 비율을 80%라는 사전 기준값에서 얼마나 멀어지게 할지 결정합니다. 재무 요인에는 연간 매출이 사용됩니다. 공급업체 다양성 지표나 규모 표시가 점수 산출 공식에 직접 포함되지 않더라도 이는 중대한 결과를 초래하는 선택입니다. 보다 광범위한 종합 평가에서는 다양성 지표를 사용하여 집단을 비교하고 방침을 적용합니다.

Apex의 거래 4,200건 및 감사 140회에 비해 Bridgepoint는 거래 180건 및 감사 9회에 불과합니다. 따라서 Bridgepoint의 우수한 원시 수치는 원래 점수에서 상대적으로 낮은 가중치를 받게 됩니다. 매출 또한 소규모 공급업체와 대형 공급업체 간의 또 다른 격차를 만들어냅니다. 결국 배제 결정에는 측정된 성과, 근거 데이터의 양, 선택된 재무 대리 지표의 복합적인 영향이 반영되어 있습니다.

Bridgepoint의 공급업체 기록에는 플랫폼 점수 70.9점, 대리 지표 중립 점수 81.0점, 원시 납기 및 품질률, 거래 이력 건수, 매출 및 요인별 기여도가 표시됩니다.
합성 Bridgepoint 기록은 원시 성과와 근거 데이터 양을 두 점수와 함께 나란히 배치하여 적격성 변화에 검토 가능한 근거를 제공합니다.

이것이 재검토를 위한 유용한 출발점입니다. 더 나은 납기율이 구매 결정을 완전히 종결짓는 것은 아닙니다. 하지만 '공급업체의 점수가 너무 낮았다'는 말이 불완전한 설명임을 분명히 드러냅니다.

대안 공식은 의견 차이를 구체화합니다

MeritLens의 대리 지표 중립 미리보기는 모든 공급업체의 원시 납기 및 품질률을 온전히 인정하고, 매출 대신 재무 건전성을 직접 활용하며, 가격 및 요인별 가중치를 그대로 유지합니다. 이는 명시적인 대안 계산이므로 구매자는 무엇이 완화되었고 무엇이 유지되었는지 정확히 파악할 수 있습니다.

해당 대안에 따르면 Bridgepoint는 81.0점을 얻어 미리보기 후보 명단에 진입합니다. Apex는 88.0점을 기록하며 선두 자리를 유지합니다. 원래 21.0점이던 격차는 7.0점으로 좁혀집니다. 원래 격차의 약 3분의 2는 설정된 거래 이력 및 매출 가정에 기인합니다. 이러한 원인 귀속은 대안 공식에 기초한 것이며, 현실 세계에서의 차별에 대한 인과적 증명은 아닙니다.

저는 의견 불일치의 위치를 짚어내기 위해 이 대안을 사용합니다. 원시 비율은 수용하지만 재무 지표로서의 매출에 이의를 제기하는 구매자는, 9회의 감사가 충분한 품질 근거를 제공하는지 의심하는 구매자와는 서로 다른 반론을 제기하는 것입니다. 두 가지 우려를 하나의 총점으로 합산해 버리면 어떤 가정에 방어가 필요한지 가려지게 됩니다.

또한 이 미리보기는 단순화된 공정성 논리에 불편한 사실 하나를 그대로 보존합니다. 바로 Bridgepoint의 재무 건전성이 더 낮다는 점입니다. 해당 요인에서 매출을 제외하더라도 재무적 차이가 사라지는 것은 아니며, 우수한 납기 능력이 모든 정당한 기준에서 Bridgepoint를 더 우월하게 만들어 주는 것도 아닙니다. 유용한 설명이라면 남아 있는 이러한 불리한 조건도 계속 가시적으로 보여주어야 합니다.

MeritLens의 대리 지표 중립 미리보기에서는 Apex가 88.0점, Bridgepoint가 '진출' 라벨과 함께 81.0점으로 표시되며, 원래의 Apex 추천 및 낙찰 차단 패널도 그대로 표시됩니다.
대안 공식에 따라 Bridgepoint는 적격성을 획득하고, Apex는 여전히 선두를 지키며, 저장된 낙찰 차단 패널 역시 계속 표시됩니다.

원래의 추천 및 저장된 BLOCK 판정은 변경되지 않은 상태로 유지됩니다. 이 미리보기는 계약을 체결하지 않으며, 원래의 채점 엔진을 대체하거나 기록된 카테고리 평가를 재채점하지도 않습니다. 여기에 제시된 모든 공급업체와 낙찰은 합성 또는 시뮬레이션된 것이며, 데모는 실제 조달 플랫폼과의 실시간 연결을 포함하지 않습니다. 자세한 내용은 MeritLens 설명서에서 계산 및 결정 경계를 확인하실 수 있습니다.

불이익을 없애는 데는 대가가 따릅니다

핵심적인 난제는 제한된 거래 이력이 적격성을 낮추어야 하는가의 문제입니다. 적은 수의 관측치에 기반한 원시 수치는 수많은 관측치로 뒷받침되는 동일한 수치보다 적은 정보를 제공합니다. 구매자가 그러한 불확실성을 염려하는 것은 당연히 합리적입니다. 미리보기가 수행하는 것처럼 모든 원시 수치를 전적으로 인정하는 것은 거래 이력에 따른 불이익을 없애주지만, 동시에 근거 데이터의 양에 맞춘 공식의 보정 장치도 제거하게 됩니다.

저는 이 미리보기를 대체 조달 정책으로 취급하지 않습니다. 적격성 판정이 해당 보정에 얼마나 크게 의존하고 있는지를 명확히 드러내기 때문에 유용한 것입니다. 만약 어떤 팀이 불충분한 근거를 평가할 다른 방안 없이 대안을 채택한다면 미해결된 리스크를 감수하는 셈이 됩니다. 반대로 원래 공식을 그대로 고수한다면, 관측된 성과가 더 뛰어난 공급업체라 하더라도 거래 이력이 적다는 이유로 계속 배제되는 결과를 감수해야 합니다.

실패의 대가가 막대한 가상의 구매 상황에서는 보수적인 적격성 규칙을 유지하는 것이 합당할 수 있습니다. 그 정당화 과정에서는 해당 규칙이 어떤 불확실성을 다루고 있으며 요구되는 이력이 왜 해당 구매에 유의미한지 설명해야 합니다. 계약 확정 전에 팀이 부족한 근거를 조사할 여유가 있는 가상 구매라면, 민감한 배제 건을 재검토 경로로 보내는 것이 더 바람직할 수 있습니다. 이 경로는 시간과 주의를 요하지만, 팀이 미해결된 근거 우려와 실제 성과 미달을 구별할 수 있게 해줍니다.

이러한 판단은 구매자의 몫이며 MeritLens가 시연하는 추가 기능이 아닙니다. 데모는 점수 비교와 보류 조치를 보여줄 뿐입니다. 실제 조직이 감수해야 할 조달 리스크를 규정하거나 완료된 사람의 평가를 보여주는 것이 아닙니다.

저의 설계 원칙은 의견 불일치를 핵심적인 위치에서 투명하게 보존하는 것입니다. 재검토를 통해 배제가 타당했다는 결론을 내릴 수도 있어야 합니다. 또한 도전자에게 묵시적으로 낙찰을 넘기지 않으면서 수정이 필요한 가정을 식별할 수 있어야 합니다. 최종 후보 적격성과 공급업체 선정은 엄연히 별개의 결정입니다.

정책의 결과에는 그 이유가 수반되어야 합니다

파스너 사례에서 보류 결정은 구체적인 근거를 가지고 있습니다. 설정된 카테고리 진단이 선정 불균형을 경고하고, 기존 최고 득점자는 비다양성 기성 공급업체 라벨을 가지고 있으며, 기존 점수로 배제되었던 다양한 도전자들이 대안에 따라 최종 후보 기준선에 도달합니다. 이러한 조건들이 결합하여 BLOCK 판정을 생성하고 시뮬레이션된 낙찰에 대해 인간의 검토를 요구하게 됩니다. 개별 점수 하나가 바뀌었다는 사실만으로는 이 규칙을 작동시키기에 충분하지 않습니다.

반대편 경계도 마찬가지로 중요합니다. 별도의 합성 포장재 사례에서는 대리 지표 중립 미리보기에서 한 공급업체가 적격성을 얻음에도 불구하고 카테고리 진단은 PASS를 반환하고 게이트는 ALLOW를 승인합니다. 일부 개별 공급업체 계층은 설정된 보호 장치 하에서 평가하기에는 표본이 너무 작습니다. ALLOW는 이 정책의 결과를 기술할 뿐이며, 모든 계층이 평가되었거나 모든 배제가 대리 지표의 영향을 받지 않는다는 것을 입증하지는 않습니다. 이러한 진단은 사전에 구성된 데모 규칙일 뿐 조달법적 판결이 아닙니다.

이러한 경계는 구매자에게 실용적인 평가 기준을 제공합니다. 즉, 규칙이 적용 범위 밖으로 남겨둔 사례들과 함께 결과 이면의 사유를 점검하라는 것입니다. 좁은 정책 하에서 녹색 라벨이 정확할 수는 있지만, 구매에 중요한 질문을 미해결 상태로 남겨둘 수 있습니다. 민감한 모든 배제를 보류하도록 규칙을 확장하면 더 많은 사례를 포괄할 수 있지만, 인간의 검토로 회부되는 결정 또한 늘어나게 됩니다. 팀은 그러한 업무량을 신중하게 선택해야 합니다.

동일한 권한 분립 원칙이 AI 설명 기능에도 적용됩니다. MeritLens는 자문적 요인 검토를 진행하기 전에 확정적인 게이트 결정과 감사 로그를 기록합니다. 완료된 모델 설명은 변경되지 않은 입력값에 대해 재사용될 수 있으며, 핵심 결정은 모델 호출 없이도 작동합니다. 자문적 설명글은 요인 해석을 명료화하거나 이의를 제기할 수 있지만, 수치적 근거 자료나 저장된 결과를 다시 쓸 수는 없습니다. 따라서 설득력 있는 문구는 정의된 역할을 수행하되 그 자체가 진행 허가증이 되지는 않습니다.

제가 설명하는 글을 읽는 대신 실제로 작동하는 모습을 직접 확인하고 싶으시다면, 여기에서 전체 프로세스가 처음부터 끝까지 구동되는 모습을 보실 수 있습니다.

조달 AI 시스템을 평가할 때, 저는 구매자가 배제 과정을 온전히 재구성할 수 있기를 바랍니다. 원래 점수, 각 요인을 뒷받침하는 근거, 적격성을 변화시키는 가정, 여전히 남아 있는 불리한 요건, 그리고 다음 단계를 규율하는 명확한 규칙을 말입니다. 대안 점수는 그러한 판단을 더욱 명확하게 해줄 때 비로소 가치를 얻습니다. 최종적인 책임은 팀이 수용하기로 선택한 불확실성까지 포함하여 구매 결정을 충실히 방어하는 데 있습니다.

관련 연구

다른 채널에도 게시됨

확신을 가지고 AI를 구축하세요.

차세대 엔터프라이즈 AI 구축에 깊은 경험을 갖춘 팀과 협업하세요. 신뢰할 수 있는 AI 전략을 설계하고 구축하며 배포할 수 있도록 지원해 드리겠습니다.

Veriprajna 딥테크 컨설팅 은(는) 헬스케어, 금융, 규제 분야를 위한 안전 필수 AI 시스템 구축을 전문으로 합니다. 당사의 아키텍처는 확립된 프로토콜에 따라 검증되며 포괄적인 규정 준수 문서를 갖추고 있습니다.