대기 보정, 구역 수준의 예찰 경로, 검토 가능한 기록이 왜 분류기 외부에 배치되어야 하는지 보여주는 초분광 작물 AI 데모
Precision AgricultureRemote SensingVariable Rate Technology

초분광 작물 AI에 원시 복사휘도를 입력했습니다. 미공개 합성 테스트에서 점수는 0.887에서 0.373으로 급락했습니다.

Ashutosh SinghalAshutosh Singhal2026년 7월 14일10 min

단지 "스트레스"라고만 알리는 NDVI 경보는 재배자가 질소 공급, 관개, 초기 타르 점무늬병 예찰 중 무엇을 선택해야 할지 판단할 수 없게 만듭니다. 저는 바로 그 결정을 중심으로 SpectraRx를 개발했습니다. 물리 기반의 이 합성 데모에서 의도적으로 손상시킨 경로를 따를 경우, 동일한 424밴드 분광 CNN은 0.887에서 0.373으로 보정된 지표면 반사율 대신 가공되지 않은 대기 상단 복사휘도를 입력했을 때 미공개 테스트에서 떨어집니다.

제가 데모에 이러한 실패 사례를 포함한 것은 단순한 눈속임용 묘기가 아닙니다. 입력을 의미 있게 만들어 주는 조건이 결여된 작물 스트레스 점수는 깔끔한 지도를 잘못된 현장 의사결정으로 이끄는 위험한 유혹이기 때문입니다. 데모의 장면들은 단일 옥수수 작물과 단일 지역에 대해 물리 법칙에 기반하여 생성된 합성 큐브 데이터이며, 실제 촬영 영상이나 현장 보증이 아닙니다. 핵심은 가정을 투명하게 드러내면서 전체 결정 체인을 직접 검사할 수 있도록 만드는 것입니다.

원인이나 처방 없이 스트레스 상태로 태그된 하나의 황색 영역을 보여주는 SpectraRx의 NDVI 위성 뷰
SpectraRx의 NDVI 탭: 하나의 황색 영역이 원인이나 처방이 첨부되지 않은 채 "스트레스"로 태그되어 있습니다.

제가 단 하나의 황색 NDVI 덩어리에서 이야기를 시작하는 이유는 그것이 단순 탐지 경보의 한계를 명확히 보여주기 때문입니다. 더 자세히 살펴보라는 신호로서는 유용하지만, 27미터 붐대가 질소 시비량을 변경해야 하는지, 수분 스트레스 패턴에 대한 점검이 필요한지, 아니면 초기 타르 점무늬병 때문에 농학자가 현장에 나가야 하는지는 알려줄 수 없습니다. 저는 데모가 그 다음 질문에 답하고, 그 답의 근거와 한계까지 함께 보여주기를 원했습니다.

veriprajna.com/demos/hyperspectral-agriculture-ai에서 직접 이 체인을 실행해 볼 수 있습니다. 화면은 불편한 진실을 숨기지 않습니다. 대기 보정을 건너뛰고 의사결정 경로가 어떻게 바뀌는지 직접 관찰할 수 있습니다.

캘리브레이션이 분류기가 바라보는 대상 자체를 바꾼다는 사실을 배웠습니다

예전에 저는 대기 보정을 단순한 사전 준비 작업 정도로 여겼습니다. 데이터 큐브는 대기 상단(TOA) 복사휘도로 입력되며, 데모의 경험적 라인 보정(empirical-line correction)은 장면에 캘리브레이션 출처 정보를 첨부하여 이를 지표면(BOA) 반사율로 변환합니다. 제가 이를 의도적으로 우회하기 전까지는, 이러한 구분이 단순한 엔지니어링 배관 작업처럼 들렸습니다.

학습된 네트워크와 가중치는 그대로 고정했습니다. 입력 경로만 변경했습니다. 학습에 포함되지 않은 미지의 품종과 토양에서 추출한 1,280개 픽셀에 대한 미공개 물리 기반 합성 테스트에서, 결과는 매크로 F1 0.887에서 0.373으로 떨어졌습니다. 이는 이 모델과 이 테스트에 대해 측정된 결과일 뿐, 모든 초분광 모델이 동일한 폭으로 실패할 것이라는 주장은 아닙니다.

저는 이 대비가 더 방대한 벤치마크 표보다 훨씬 유용하다고 느꼈습니다. 실질적인 실패를 구체적으로 보여주기 때문입니다. 보정되지 않은 경로는 단순히 노이즈가 더 많은 입력에 그치지 않습니다. 가공되지 않은 복사휘도는 보정된 지표면 반사율을 해석하도록 설계된 분류기에 대기 및 조명 효과를 그대로 끌고 들어옵니다. 신경망은 여전히 클래스와 신뢰도를 반환할 수 있지만, 둘 중 어느 것도 처방을 승인하기에는 충분한 근거가 되지 못합니다.

대기 보정 건너뛰기 토글이 활성화되어 미공개 합성 테스트 점수가 0.887에서 0.373으로 떨어지고 seed-7 픽셀 대부분이 기권 처리된 모습
"대기 보정 건너뛰기"를 켜면 미공개 합성 테스트 수치가 0.887에서 0.373으로 떨어집니다. 캘리브레이션이 생략된 seed-7 장면에서는 92.2%의 픽셀이 기권하고, 144개 중 140개 구역이 예찰로 라우팅되며, 4개의 수분 스트레스 구역에는 여전히 살포가 적용됩니다.

제가 가공되지 않은 복사휘도 경로를 공개적으로 드러낸 이유는 정확도 수치 하나만으로는 운영상의 핵심 질문, 즉 시스템이 스스로 취약한 기반 위에 있음을 발견했을 때 어떻게 대응해야 하는가를 다룰 수 없기 때문입니다. SpectraRx에서의 해답은 전면적인 차단이 아닙니다. 이 의도적인 테스트에서도 가공되지 않은 TOA는 여전히 분류기에 도달하며, 다운스트림 신뢰도 및 물리 일치성 게이트가 불확실성을 가시화합니다.

저는 이 결과를 신경망이 무용지물이 되었다는 주장과 엄격히 구분하는 데 시간을 들였습니다. 이 분류기는 400에서 2515 nm에 이르는 424개 전체 밴드 곡선을 읽는 맞춤형 1차원 분광 CNN입니다. 평상시의 역할은 BOA 지표면 반사율로부터 정상, 질소 결핍, 수분 스트레스, 초기 타르 점무늬병 픽셀을 구분하는 것입니다. 캘리브레이션 실험은 작물 클래스를 변경하거나, 모델을 재학습시키거나, 더 취약한 베이스라인으로 슬그머니 교체하지 않습니다. 업스트림 조건 하나만을 변경한 뒤 나머지 의사결정 체인이 그 결과를 투명하게 드러내도록 할 뿐입니다.

저는 이것이 유용하다고 생각했습니다. 보통 점수가 나쁘면 또 다른 점수를 요구하기 마련이기 때문입니다. 하지만 이번에는 다른 질문이 필요했습니다. 입력이 변경된 후 시스템이 조치를 취할 근거는 무엇인가? 답은 캘리브레이션 출처에서 시작되지만 거기서 끝날 수는 없습니다. 신뢰도 값은 단 하나의 신호일 뿐입니다. 예상되는 레드 에지 이동이 없는 질소 판정처럼 CNN의 분류 결과가 문서화된 물리적 특성과 충돌할 때 물리 일치성 검사는 기권할 수 있습니다. 또한 인스펙터는 전체 곡선과 밴드별 현저성 추적(band-saliency trace)을 표시하여 운영자가 모델의 근거를 문서화된 진단 기준과 비교할 수 있도록 합니다.

저는 그 인스펙터를 무결성의 증명이 아니라 책임성을 검증하는 도구로 활용합니다. 초기 타르 점무늬병의 경우, 추적에서 샘플링된 530 및 535 nm 빈은 531 nm 부근의 PRI 진단 영역과 가장 가깝습니다. 질소의 근거는 680에서 720 nm에 이르는 레드 에지 범위에 있습니다. 수분의 SWIR 특성은 모델의 최상위 현저성 피크라고 주장하기보다는 진단 검사 항목에 가깝습니다. 이러한 점검은 판단 근거를 직접 검사할 수 있게 해 줍니다. 합성 벤치마크를 실제 현장 보증으로 둔갑시키지는 못하며, 입력 경로의 신뢰도가 떨어졌을 때 예찰이 필요하다는 사실을 없애 주지도 않습니다.

저는 실패 사례를 더 극적으로 보이게 하려고 베이스라인을 일부러 취약하게 만들지도 않았습니다. 미공개 합성 분포 변화 테스트에서 실제 Sentinel-2 광대역 기존 모델은 매크로 F1 0.69를 기록합니다. 레드 에지와 SWIR 밴드를 갖추고 있어 질소 항목에서는 1.0에 가깝습니다. 초분광 모델은 전체적으로 0.887에 도달하며, 수분 스트레스와 초기 타르 점무늬병에서 가장 강력한 구조적 우위를 보입니다. 이는 의미 있는 비교이지만, 캘리브레이션이 생략된 후 특정 구역에 처방을 내려야 하는지 여부까지 결정해 주지는 못합니다. 게이트와 구역 규칙은 바로 그 후속 운영 질문에 답하기 위해 존재합니다.

단순히 대시보드 색상만 바꾸는 것이 아니라 현장 조치를 변화시키는 안전장치가 필요했습니다

저는 기권(abstention)이 또 다른 모호한 약속으로 전락하지 않도록 주의를 기울였습니다. 빗금 친 픽셀은 신뢰도가 낮거나, 신호(signature)가 혼재되어 있거나, 분류기가 문서화된 물리적 특성과 상충할 때 시스템이 픽셀 수준의 진단을 보류하고 있음을 의미합니다. 기본 보정된 seed-7 데모 장면에서는 20.1%의 픽셀이 기권한 것으로 나타납니다. 이 수치는 해당 장면에 대한 앱 내 관찰 결과일 뿐, 보편적인 평가 지표는 아닙니다.

그런 다음 운영자가 이러한 픽셀이 포함된 지도를 가지고 무엇을 해야 하는지 결정해야 했습니다. 방제기는 픽셀 단위로 하나씩 작동하지 않습니다. SpectraRx는 27미터 붐 프로파일을 사용하여 5미터 진단 픽셀을 25미터 관리 셀로 집계합니다. 규칙은 명확하게 공개되어 있습니다. 기권 픽셀이 34% 이상인 구역은 지상 실측 예찰로 라우팅되고, 나머지 구역은 기권하지 않은 다수 클래스를 따릅니다.

저는 이 규칙이야말로 불확실성이라는 추상적인 개념이 실질적인 워크플로로 전환되는 지점이라고 생각합니다. 캘리브레이션이 생략된 seed-7 장면에서는 92.2%의 픽셀이 기권하고, 144개 중 140개의 관리 구역이 예찰로 라우팅됩니다. 구역 규칙에 따라 여전히 4개의 수분 스트레스 구역에는 살포가 적용됩니다. 시스템은 열린 세계의 관점에서 이 4개 구역이 안전하다고 입증한 것이 아닙니다. 변경된 모든 입력이 살포 아니면 빈 화면 중 하나만을 도출해야 하는 척하는 대신, 시스템의 조건과 라우팅 규칙을 검토할 수 있도록 공개한 것입니다.

저는 또한 의구심을 가진 원격 탐사 독자가 단순한 게이트 이상의 것을 볼 수 있기를 바랐습니다. 분광 인스펙터는 424개 밴드 곡선과 주황색 밴드별 현저성 추적을 보여줍니다. 초기 타르 점무늬병의 경우, 샘플링된 530 및 535 nm 현저성 빈은 531 nm 부근의 PRI 진단 영역과 가장 가깝고, 질소의 근거는 680에서 720 nm 레드 에지 범위에 나타납니다. 수분의 경우, 문서화된 SWIR 특성은 CNN의 가장 높은 현저성 피크에 대한 주장이 아니라 진단 검사 항목입니다. 이는 문서화된 물리적 특성과 비교 및 검사할 수 있는 기준일 뿐, 모델이 잘못된 단서를 절대 사용하지 않는다는 증거는 아닙니다.

붐대와 농학자가 실제로 활용할 수 있기 전까지는 처방이라 부를 수 없었습니다

게이트가 제 역할을 마친 후에도 진단 지도는 여전히 미완성이라는 사실을 배웠습니다. 기본 보정된 장면에는 144개의 관리 셀이 있습니다. V12 생육 단계에서 살포 21개 구역, 예찰 25개 구역, 정상 98개 구역입니다. SpectraRx는 살아남은 구역 결정을 변량 시비 처방으로 전환합니다. 질소 시비율은 심각도를 따르며, 살균제는 설정된 R3 기간에만 허용됩니다. 내보내기는 실제 ISO-XML 및 GeoJSON 형식을 지원하지만, 실시간 센서 및 농장 관리 시스템 연동은 본 데모에서 구현되지 않았습니다.

게이트를 가시화한 것과 동일한 이유로 다운스트림 기록을 결정론적으로 만들었습니다. 데모는 진단 및 처방 결과를 바탕으로 EU Farm-to-Fork IPM 양식의 기록 템플릿을 생성합니다. 여기에는 구역 좌표, 다수 클래스 구역 범위, 분광학적 근거, 평가된 대안, 권장 약제 및 시비율, R3 기한, 캘리브레이션 출처, 공인 농학자 서명란이 포함됩니다. 이는 검토용 템플릿이지 공식 제출된 규제 준수 기록은 아닙니다.

구역, 좌표, 분광학적 근거, 약제, 시비율, 캘리브레이션 출처, 농학자 서명란을 나열한 데모 생성 EU Farm-to-Fork IPM 양식 기록 템플릿
데모가 생성한 EU Farm-to-Fork IPM 양식 기록 템플릿에는 각 구역의 좌표, 분광학적 근거, 약제 및 시비율, R3 기한, 캘리브레이션 출처, 검토용 농학자 서명란이 포함되어 있습니다.

저는 이 신뢰 경로에서 언어 모델을 배제했습니다. 신호 처리, 학습된 분광 분류기, 결정론적 게이트, 장비 연산, 기록 템플릿이 핵심 의사결정을 담당합니다. 선택적 모델은 이미 계산된 사실로부터 IPM 정당화 문구를 생성할 수 있으며, API 키 없이도 데모가 실행되도록 템플릿 기반 폴백이 제공됩니다. 언어 모델은 작물에 무엇이 필요한지, 구역에 예찰이 필요한지를 결정하지 않습니다.

분류기 하나만으로 제품을 평가하는 일을 멈추었습니다

여전히 분류기에 신경을 쓸 수는 있습니다. 미공개 합성 분포 변화 테스트에서 SpectraRx는 기존 Sentinel-2 광대역 모델의 0.69에 맞서 매크로 F1 0.887을 기록합니다. 그 차이는 수분 스트레스(0.97 대 0.63)와 초기 타르 점무늬병(0.77 대 0.61)에서 가장 두드러집니다. 질소는 양쪽 모두 1.0에 근접하는데, 이는 기존 모델을 허수아비가 아닌 실제 비교 기준으로 삼을 수 있어 매우 유용합니다.

저는 이러한 결과를 실제 노지에 대한 주장으로 내세우지 않습니다. 이는 1,280개의 미공개 합성 픽셀, 단일 작물, 단일 지역을 대상으로 한 것입니다. 누군가 실제 환경에서의 정확도를 주장하기 위해서는 여전히 2개 시즌에 걸친 지상 실측 라이브러리가 필요합니다. 제가 이 데모에서 얻은 교훈은 더 좁고 실용적입니다. 분류 점수는 의사결정 시스템의 한 부분에 불과하며, 작동 조건 없이 가장 자주 인용되기 쉬운 부분이기도 하다는 점입니다.

제가 SpectraRx에 캘리브레이션 실패 사례를 구현한 것은 바로 그러한 작동 조건을 수면 위로 드러내기 때문입니다. 입력의 변화, 점수의 하락, 불확실성을 드러내는 다운스트림 게이트, 예찰 경로를 지정하는 구역 규칙, 운영자와 검토자가 확인해야 할 사항을 보존하는 처방 기록을 보여줍니다. 소수점 이하 자리수를 더 높이기 전에 제가 개선하고자 하는 작업이 바로 이 일련의 체계입니다.

글로 된 설명을 읽기보다 직접 확인하고 싶으시다면, 전체 시스템이 처음부터 끝까지 실행되는 모습을 아래에서 보실 수 있습니다.

저는 데모가 솔직하게 작동하는지 테스트하고 싶을 때 veriprajna.com/demos/hyperspectral-agriculture-ai로 돌아갑니다. 진정으로 유용한 작물 AI 시스템은 특정 장면의 신뢰도가 왜 낮아졌는지 보여주고, 그 불확실성을 현장 조치로 연결하며, 내린 결정과 내리지 않은 결정에 대한 기록을 명확히 남길 수 있는 시스템입니다.

관련 연구

다른 채널에도 게시됨

확신을 가지고 AI를 구축하세요.

차세대 엔터프라이즈 AI 구축에 깊은 경험을 갖춘 팀과 협업하세요. 신뢰할 수 있는 AI 전략을 설계하고 구축하며 배포할 수 있도록 지원해 드리겠습니다.

Veriprajna 딥테크 컨설팅 은(는) 헬스케어, 금융, 규제 분야를 위한 안전 필수 AI 시스템 구축을 전문으로 합니다. 당사의 아키텍처는 확립된 프로토콜에 따라 검증되며 포괄적인 규정 준수 문서를 갖추고 있습니다.