Ao criar o TriggerProof, uma camada de julgamento para gatilhos paramétricos de inundação, descobri que a falha real é o falso positivo, e um verificador determinístico de física o intercepta.
Parametric InsuranceRemote SensingFlood Risk

Um satélite indicou que um depósito estava sob a água. Era a sombra de uma nuvem, e o gatilho paramétrico estava a um clique de pagar US$ 1,2 milhão automaticamente.

Ashutosh SinghalAshutosh Singhal12 de julho de 202612 min

Um satélite observou o Mesa Junction Depot, detectou uma mancha escura onde deveria haver solo seco e sinalizou o local como inundado. Uma apólice paramétrica contra inundações interpretou esse gatilho como fato e preparou uma indenização de US$ 1,2 milhão para ser liberada automaticamente, sem regulador de sinistros, sem telefonema, sem uma segunda verificação. A mancha escura era a sombra de uma nuvem. Seis dias depois, ela já havia sumido das imagens, e o solo sob ela nunca esteve molhado.

Criei exatamente esse caso de propósito, porque é o tipo de situação que um único quadro de satélite jamais consegue detectar. Sou Ashutosh e lidero a Veriprajna. O TriggerProof é uma demonstração que construí para provar uma tese específica: o momento perigoso no seguro paramétrico contra inundações não é a detecção, é a decisão de pagar. Cada localidade, quadrícula, régua fluviométrica e relatório de campo nela são substitutos sintéticos e fiéis à física que desenvolvi para encenar os modos de falha com total clareza. Você pode abrir e testar tudo por conta própria em veriprajna.com/pt-BR/demos/inteligencia-de-inundacoes-por-satelite-adjudique-o-gatilho-parametrico-antes-da-indenizacao. O Mesa Junction Depot é por onde quero começar, porque foi o caso que me ensinou o que eu estava realmente construindo.

Quatro fenômenos diferentes escurecem os mesmos pixels

Eu não compreendia a real dimensão do problema até me sentar para gerar as imagens sintéticas e ter que fazer quatro coisas parecerem idênticas em um único quadro. O seguro paramétrico contra inundações substituiu o regulador de sinistros por um gatilho: um satélite diz que um local está sob a água, e o dinheiro é movimentado. O problema é que, em uma única imagem óptica ou em uma única passagem de radar, água de inundação real, a sombra de uma nuvem, uma sombra de radar ou de relevo e um reservatório permanente escurecem da mesma forma. Um único quadro não consegue separá-los, porque a informação necessária para distingui-los não existe em um único quadro.

Isso reformulou toda a demonstração para mim. O erro catastrófico neste setor não é a inundação que o gatilho deixa passar. É a inundação que o gatilho inventa, uma indenização confiante de US$ 2 milhões sobre uma sombra, sem nenhuma trilha de evidências para defender a decisão quando uma resseguradora questionar um ano depois. O TriggerProof não detecta inundações e não produz dados de satélite. Ele recebe um gatilho que já disparou e julga se o pagamento deve realmente acontecer.

Um quadro indicou inundação; o seguinte mostrou que o solo nunca esteve molhado

Ainda me lembro de navegar pela sequência de imagens do Mesa Junction na primeira vez em que ela renderizou corretamente. A interface permite abrir uma localidade sinalizada e percorrer os quadros de aquisição um a um, óptico em cima, radar embaixo. No quadro do gatilho, a mancha escura está bem ali, com sinal verde característico de água, exatamente o que acionou o alarme. Avance para a próxima aquisição e ela sumiu. Volte e o retroespalhamento de radar sob essa mesma mancha aparece normal em todos os quadros, porque o radar enxergou o solo seco através da nuvem o tempo todo.

A sequência temporal da AOI-B para o Mesa Junction Depot: a mancha escura óptica aparece apenas no quadro do gatilho t+0 e está ausente em t-6d e t+6d, enquanto a linha SAR permanece uniforme nos três quadros, classificada como sombra de nuvem com confiança de 1,00.
Mesa Junction Depot, o caso de US$ 1,2 milhão. A mancha escura óptica aparece apenas no quadro do gatilho (persistência temporal de 33%) e o retroespalhamento de radar permaneceu normal o tempo todo. A regra R1 falha, a regra R2 falha e o veredito é sombra de nuvem, não água.
A sombra se moveu; a água teria permanecido. Isso você só enxerga ao longo do tempo e através de múltiplos sensores, nunca no quadro isolado que acionou o gatilho.

A física não é sutil quando você coloca os quadros lado a lado. Uma sombra de nuvem é transitória e se desloca na velocidade das nuvens, portanto fica escura em uma aquisição e desaparece na seguinte. A água real de inundação persiste entre aquisições e aparece escura no óptico e baixa no radar ao mesmo tempo. Duas regras codificam exatamente isso: persistência temporal e concordância radar-óptica. No Mesa Junction, ambas retornam FAIL, e o classificador conclui que se trata de sombra de nuvem com confiança de 1,00. Os US$ 1,2 milhão nunca deveriam ter entrado na fila.

As cinco regras decidem, não o modelo de linguagem

Tentei, no início, deixar o modelo de linguagem tomar essa decisão, e fico feliz por ter tentado, porque ele falhou da maneira mais instrutiva possível. Coloquei um agente lendo as mesmas evidências e perguntei a ele, em essência, se o local estava realmente inundado. Em um caso ambíguo, ele redigiu um parágrafo fluente e confiante defendendo a ocorrência de inundação; ele estava errado, e nada em seu tom indicava o erro. Aquela tarde selou uma decisão de arquitetura que nunca mais reabri.

Assim, a decisão reside em Python puro, em cinco discriminadores inspecionáveis, sem nenhum modelo no fluxo que movimenta o dinheiro. A persistência temporal (R1) separa uma inundação de uma sombra passageira de nuvem. A concordância radar-óptica (R2) separa uma inundação tanto de sombras de nuvens quanto de sombras de radar. A declividade do MDE (R3) rejeita água que precisaria se acumular em terreno íngreme. Uma máscara de água permanente (R4) exclui reservatórios conhecidos. A conectividade hidrológica (R5) verifica se a área molhada realmente se conecta à rede de drenagem. O verificador decide; o modelo de linguagem apenas aconselha. O agente consultivo é construído sobre o Pydantic AI, com modelo intercambiável, tendo como padrão o claude-opus-4-8, e verifica o veredito da física em relação a sinais de solo independentes, retornando corroborates, contradicts ou inconclusive. Ele pode ser desconsiderado, e quando removo a chave de API, a demonstração roda totalmente offline em um fallback determinístico, porque a parte em que confio para liberar um pagamento não pode ser a parte que fala em parágrafos confiantes.

Quando a própria física tem dúvidas, o sistema escala em vez de adivinhar

Preocupo-me mais com o caso em que o sistema diz "não sei" do que com qualquer uma das detecções perfeitas. O Canal Street Hub é esse caso. As assinaturas óptica e de radar são limítrofes, o sinal de inundação persiste em dois dos três quadros e a régua fluviométrica independente nunca ultrapassou o nível de transbordamento. As evidências realmente entram em conflito. A confiança calculada é de 0,151, bem abaixo da régua de automação de 0,65 que defini no conjunto rotulado, e o agente de solo contradiz categoricamente a classificação de satélite.

O detalhe da AOI-F Canal Street Hub: classificado como inundação com confiança de 0,15, assinatura limítrofe no óptico e SAR, régua fluviométrica abaixo do nível de transbordamento e um veredito direcionado a um avaliador humano como ESCALATE em vez de um pagamento automático.
Canal Street Hub, US$ 0,8 milhão em jogo. O sinal é limítrofe e a régua fluviométrica nunca ultrapassou o nível de transbordamento, portanto a evidência de solo entra em conflito com o satélite. A confiança de 0,151 fica abaixo da régua de 0,65, e o caso escala para um humano com todo o dossiê probatório anexado, em vez de ser decidido automaticamente.

O gate de política envia esses US$ 0,8 milhão a um humano com todas as evidências anexadas, marcado como "needs proof", em vez de jogar uma moeda e chamar isso de automação. Um gatilho de inundação que escala casos genuinamente ambíguos soa para alguns compradores como um produto inferior. Eu vejo exatamente o oposto. É a única versão que eu deixaria rodar sem supervisão, porque a alternativa à escalação aqui é um palpite rápido com dinheiro real, disfarçado de decisão.

O número da carteira ao qual sempre retorno

Continuo voltando à carteira de oito localidades porque ela torna os riscos concretos de uma forma que nenhum caso isolado consegue. Uma tempestade atinge uma carteira de oito áreas. O gatilho legado de quadro único dispara em seis delas e coloca US$ 8,0 milhões em pagamentos automáticos na fila. O TriggerProof julga a carteira: duas inundações reais confirmadas e pagas a US$ 4,0 milhões, três falsos positivos suprimidos (uma sombra de nuvem a US$ 1,2 milhão, uma sombra de radar a US$ 1,0 milhão, um reservatório permanente a US$ 1,0 milhão), retendo US$ 3,2 milhões, e o único caso ambíguo escalado a US$ 0,8 milhão.

A carteira do TriggerProof após o julgamento: o sistema legado enfileirou US$ 8,0 milhões; US$ 4,0 milhões confirmados para pagamento em duas inundações reais; US$ 4,0 milhões retidos entre três supressões e uma escalação, com 100% de cobertura de evidências e vereditos linha a linha de PAY, DENY e ESCALATE em contraste com a coluna PAY legada.
A carteira de oito localidades após o julgamento. Dos US$ 8,0 milhões que o gatilho de quadro único teria pago automaticamente, US$ 4,0 milhões foram confirmados em duas inundações reais e US$ 4,0 milhões foram interrompidos ou retidos: US$ 3,2 milhões de falsos positivos suprimidos e US$ 0,8 milhão escalados para comprovação. Cada linha possui seu próprio dossiê forense.

Metade do que o gatilho legado teria pago, US$ 4,0 milhões de US$ 8,0 milhões, é bloqueada ou retida para comprovação. Esse é o número, e quero ser preciso sobre o seu escopo: este é o portfólio sintético da demonstração, oito casos que criei para serem fiéis à física, não uma carteira de sinistros reais. O mecanismo é real e inspecionável. Os sinistros são encenados para que você possa ver o mecanismo funcionar.

Zero decisões inseguras e a ressalva da qual não abro mão

Executei um benchmark rigoroso porque um portfólio de oito casos é uma história, não uma prova. O destaque não é uma pontuação de acurácia, é uma contagem de segurança: zero decisões automatizadas inseguras, contra 48 de uma linha de base de quadro único que paga todo caso sinalizado. Oitenta por cento dos casos se autorresolvem e os 20% incertos escalam. Entre os casos autorresolvidos, a supressão de falsos positivos é de 36 em 36 e o recall de inundações é de 12 em 12, e cada um dos 12 casos genuinamente ambíguos escala em vez de ser decidido automaticamente.

O painel de benchmark do TriggerProof em 60 casos rotulados: zero decisões automatizadas inseguras contra 48 da linha de base de quadro único, 80% de autorresolução, 100% de supressão de falsos positivos com 36 de 36 sombras negadas e 100% de recall de inundações em 12 de 12.
O benchmark rotulado de 60 casos. O número que importa é o mais à esquerda: zero decisões automatizadas inseguras contra 48 da linha de base de quadro único, com 80% autorresolvidos e o quinto incerto escalado para comprovação.
O objetivo nunca foi atingir uma pontuação perfeita no meu próprio conjunto de testes. O ponto central é que o sistema nunca toma uma decisão automatizada insegura. Quando não tem certeza, ele escala.

Essa ressalva acompanha cada um desses números, e não permitirei que seja omitida. Eles foram medidos em um conjunto fixo e rotulado de 60 casos sintéticos e fiéis à física, não constituindo uma garantia de mundo aberto nem um resultado de campo. O próximo passo honesto não é fazer uma alegação mais ambiciosa, mas sim validar o sistema em relação a arquivos reais como o Sen1Floods11 e cenas ativas do Sentinel — e isso é a primeira coisa que um projeto real entregaria, não algo que esta demonstração já tenha feito. Dizer isso com clareza é o que me permite sustentar com convicção o restante dos números.

Uma indenização que você não consegue defender no futuro é um passivo, mesmo quando estava certa

Não comecei o projeto com a intenção de transformar a trilha de evidências no elemento central, mas no final percebi que ela era a parte que uma seguradora poderia realmente defender. Uma indenização correta que você não consegue reconstruir no futuro continua sendo um passivo, porque dizer que "o satélite mandou pagar" não é uma justificativa aceita por uma resseguradora ou auditor. Assim, cada decisão — tanto um pagamento quanto uma supressão — emite um dossiê forense: a linhagem dos dados de cada quadro, a evidência de cada regra com o valor medido de cada discriminador, o registro de eliminação de falsos positivos, o cruzamento independente com dados de solo e um hash SHA-256 de procedência da decisão.

O dossiê forense de gatilho de inundação para o Mesa Junction Depot: veredito DENY, tabela de evidências das cinco regras exibindo R1, R2 e R5 como FAIL com suas leituras medidas, registro de eliminação de falsos positivos, referência cruzada contextual e tabela de linhagem de dados do Sentinel-1 e Sentinel-2.
O dossiê por trás da recusa do Mesa Junction. Cada regra apresenta seu valor medido e resultado, o registro de eliminação de falsos positivos detalha por que não era uma inundação e o registro completo traz um hash SHA-256. Este é o documento que você apresenta a uma resseguradora, não uma captura de tela de um dashboard.

Quero ser cuidadoso sobre o que esse hash é e o que ele não é. Trata-se de um hash de conteúdo que torna o registro à prova de adulterações, para que qualquer pessoa possa recalculá-lo e verificar se a decisão não foi alterada após o fato. Não se trata de uma assinatura digital PKI, e a recuperação de satélite, o agendamento SAR, as fontes de dados de solo e a integração com plataformas de sinistros estão todos em stub nesta demonstração, simulados para que tudo rode no meu laptop. O que é real é a estrutura do registro: para cada decisão automatizada de indenização, exatamente qual física disse o que, com qual nível de confiança, confrontada com qual sinal independente.

O seguro paramétrico fez uma troca legítima, abrindo mão do regulador de sinistros para tornar os pagamentos instantâneos e incontestáveis. O que ele herdou foi um problema de física que não consegue enxergar além de um único quadro, e a falha a que essa troca o expõe é uma indenização rápida e confiante sobre uma sombra. A solução duradoura reside fora do modelo: regras determinísticas que separam elementos visualmente idênticos ao longo do tempo e entre sensores, um gate que encaminha casos ambíguos para uma pessoa e um registro que torna cada decisão defensável. Um satélite com melhor resolução não resolve um problema de julgamento, e este é um problema de julgamento.

E se você prefere assistir a me ver descrevendo, aqui está a demonstração completa rodando de ponta a ponta.

O Mesa Junction é o caso ao qual sempre retorno. Somente a segunda aquisição soube a diferença entre a sombra e a inundação, e o gatilho disparou antes de ela chegar. Você mesmo pode navegar por essa sequência temporal e invalidar o pagamento que achava que deveria ter disparado, em veriprajna.com/pt-BR/demos/inteligencia-de-inundacoes-por-satelite-adjudique-o-gatilho-parametrico-antes-da-indenizacao. A pergunta que eu faria a qualquer um que gerencie uma carteira de inundações automáticas é direta e passível de resposta: dos gatilhos que você pagou automaticamente na última temporada, quantos você ainda conseguiria provar que eram água e não uma sombra?

Pesquisa relacionada

Também publicado em

Construa sua IA com confiança.

Faça parceria com uma equipe que tem profunda experiência na construção da próxima geração de IA empresarial. Deixe-nos ajudá-lo a projetar, construir e implementar uma estratégia de IA em que você possa confiar.

Veriprajna consultoria de Deep Tech é especializada na construção de sistemas de IA críticos para a segurança nas áreas de saúde, finanças e domínios regulatórios. Nossas arquiteturas são validadas em relação a protocolos estabelecidos, com documentação de conformidade abrangente.