
418킬로볼트는 정상으로 보였다. 그리고 6천만 명이 전력을 잃었다
2025년 4월 28일 오후, 스페인의 한 관제실 화면들은 모든 것이 정상이라고 말하고 있었습니다.
400킬로볼트 송전 모선은 약 418kV를 가리키고 있었습니다 — 높긴 했지만, 운영자가 감내하도록 훈련받은 한계 안이었습니다. 그런데 5초 만에 15기가와트의 발전이 트립되어 오프라인 상태가 되었고, 스페인과 포르투갈 전역의 6천만 명이 전력을 잃었습니다. 그중 일부는 열 시간 동안 정전 상태로 남아 있었습니다.
저는 상호연계 클러스터 연구와 용량 경매 사후 분석을 다루며 경력을 쌓아 왔습니다. 그래서 2026년 3월 ENTSO-E 최종 보고서가 나왔을 때, 저는 그것을 아는 사람의 부검 기록을 읽듯이 읽었습니다. 헤드라인들은 이미 이야기를 결정지어 놓은 상태였습니다: 태양광이 너무 많고, 회전하는 금속(관성)이 충분치 않으며, 재생에너지는 그리드를 지탱하지 못한다는 것이었죠. 보고서는 이 프레이밍이 틀렸다고 분명한 언어로 말합니다. 그리드는 무엇을 발전하고 있었는지 때문에 무너진 것이 아닙니다. 아무도 지켜보지 않던 것 때문에 무너진 것입니다. 바로 그 하나의 구분이 우리 팀이 전력망 AI를 지금과 같은 방식으로 구축하는 이유입니다.
사각지대는 두 전압 단계 아래에 있었다

조사는 저를 잠 못 이루게 한 무언가를 발견했습니다.
늦은 오전부터 준동기 진동이 0.21Hz와 0.63Hz로 스페인 그리드 전역에 나타났습니다. 운영자들은 교과서적인 조치를 취했습니다 — 과도 저전압을 관리하기 위해 션트 리액터를 분리한 것인데 — 이는 그리드가 흡수하는 무효 전력의 용량을 조용히 고갈시켰습니다. 정오 무렵 그들은 병렬 400kV 회로에 전기를 투입하고 HVDC 링크를 고정 전력 모드로 전환했습니다. 임피던스가 떨어지고 전압이 올라갔습니다. 400kV 표시 화면은 여전히 418kV를 가리켰습니다. 정격 수준이었죠.
두 단계 아래, 풍력과 태양광 발전 단지가 실제로 연결되는 220kV 수집 변전소에서는 전압이 242kV에 이르고 있었습니다. 변압기 탭 체인저 — 전압을 다시 범위 안으로 밀어 넣는 기계 장치 — 는 충분히 빠르게 움직이지 못했습니다. 그리고 아무도 그것을 보지 못했는데, 실시간 모니터링이 사실상 송전 레벨에서 멈춰 있었기 때문입니다. 그러다 한 대형 발전 설비가 과전압 사건이 발생한 동안, 주입했습니다 — 흡수해야 할 무효 전력을 오히려 그리드로 밀어 넣은 것으로, 이는 해당 설비의 그리드 코드가 요구한 것과 정확히 반대였습니다. 그것이 바로 양(+)의 피드백 루프였습니다. 보호 계전기들이 연쇄적으로 트립되기 시작했고, 불이 꺼졌습니다.
재생에너지가 불안정했던 것이 아닙니다. 관측성이 불안정했던 것입니다.
저는 그 418kV라는 숫자로 자꾸 되돌아가게 됩니다. 평온한 송전 계측값을 보고 있던 운영자에게는, 수집 레벨이 이미 돌이킬 수 없는 지점을 지났다는 것을 알려 주는 계기가 하나도 없었습니다. 220kV를 볼 수 있는 센서는 존재합니다. 그것을 실시간으로, 조치를 취할 만큼 빠르게 해석하는 분석은 존재하지 않았습니다. 이것은 발전 문제가 아닙니다. 발전 문제의 옷을 입은 정보 문제입니다.
나는 답이 자율 제어기라고 확신했다. 그리고 틀렸다.
우리 팀이 처음 이 일을 맡았을 때, 저에게는 자신감 넘치고 깔끔한 아이디어가 있었습니다: 물리 정보 기반 신경망 — 실제 전력 조류 방정식을 훈련에 녹여 넣어 물리적으로 불가능한 것을 추천할 수 없게 만든 모델 — 을 구축하고, 그것이 어떤 사람이나 레거시 제어기보다 빠르게 전압과 무효 전력을 관리하게 하는 것이었습니다.
이러한 모델을 뒷받침하는 연구의 추진력은 실제입니다. 물리 정보 기반 신경망 관련 논문은 2019년 열 편 미만에서 2025년 약 820편으로 늘었습니다. 우리는 프로토타입을 구축했습니다. 대부분의 시나리오에서 그것은 정말로 인상적이었습니다 — 표준 모델보다 일반화가 더 잘 되었고 물리 법칙을 존중했습니다.
그다음 우리는 그것을 엣지 케이스들에 통과시켰습니다. 그리고 그중 하나에서, 이베리아 그리드가 겪은 것과 정확히 같은 종류의 진동 스트레스 아래에서, 그것은 물리적으로 실현 불가능한 추천을 내놓았습니다. 눈에 띄게 파국적으로 틀린 것이 아니라 — 미묘하게 틀린, 대시보드에서는 그럴듯해 보이는 종류의 틀림이었습니다.
저는 한동안 그것을 곱씹었습니다. 그런 다음 그 접근법 전체를 끝장낸 일을 했습니다: 저는 그 추천이 실제 관제실에, 4월 28일 같은 날 12시 32분에, 연쇄 장애가 조여 오고 운영자가 그것을 믿을지 말지 몇 초 안에 결정하는 상황에서 도착하는 장면을 상상했습니다. 2026년 초 현재 세계 어디에도 실제 그리드를 제어하는 상업적으로 배치된 물리 정보 기반 신경망은 존재하지 않으며, 그 테스트 이후 저는 그 이유를 정확히 이해했습니다. 이상화된 방정식 집합은 다중 스케일의 지저분함 — 경계 복잡성, 비선형 결합 — 을 생략하는데, 이것들은 정확히 그리드가 스트레스를 받아 모델이 가장 필요할 때 나타납니다. 두 가지 미해결 문제가 이를 가중시킵니다: 물리 충실도와 데이터 적합성을 맞바꾸는 손실 함수 가중치의 균형을 잡는 것, 그리고 모델이 언제 불확실한지를 정량화하는 것 — 둘 다 실제 운영 중에 발견하고 싶지 않은 것들입니다.
한 투자자가 이전에 저에게 그리드 운영자들은 결코 AI를 도입하지 않을 것이라고 말한 적이 있습니다. 그는 이유에 대해서는 틀렸지만, 직감은 옳았습니다. 그 이유는 운영자들이 러다이트여서가 아닙니다. 그들이 6천만 명의 결과에 대해 개인적으로 책임을 지기 때문이며, 이따금, 확신에 차서, 눈에 보이지 않게 틀리는 블랙박스는 아예 상자가 없는 것보다 더 나쁘기 때문입니다.
우리는 운영자의 판단을 대체하는 무언가를 만들려는 시도를 멈추고, 운영자의 시야를 확장하는 무언가를 만들기 시작했습니다.
그 전환 — 자율 제어기에서 물리 정보 기반 자문 계층으로의 전환 — 이 이제 전체 아키텍처입니다. 모델은 운영자가 현재 볼 수 없는 것을 표면으로 드러내고, 왜 그것을 표시하는지 설명하며, 설정값은 사람의 손에 맡깁니다. 관제실 운영자를 위한 다중 에이전트 시스템인 아르곤 국립 연구소의 GridMind 프로젝트는 연구 측면에서 동일한 설계 원칙에 도달했습니다: 에이전트는 운영자를 대체하지 않고, 설명 가능한 추천을 제공합니다. 독립적인 팀들이 같은 제약에 수렴할 때, 그것은 대개 그 제약이 실재하기 때문입니다.
기존 그리드 소프트웨어는 왜 이미 이것을 하지 않는가?
타당한 질문입니다. 그리드는 백지 상태(그린필드)가 아니기 때문입니다. 지구상에서 가장 유능한 몇몇 소프트웨어 기업들이 이미 이곳에 살고 있습니다.
GE Vernova의 GridOS 플랫폼은 미국 유틸리티의 80% 이상에 설치되어 있습니다; 2025년 한 해에만 Alabama Power에서 약 1억 1,200만 고객-분의 정전을 예방했습니다. Siemens의 Gridscale X는 그리드 디지털 트윈을 운영하며, NVIDIA 파트너십을 통해 시뮬레이션에서 약 10,000배 가속을 주장합니다. 이것들은 진지한 사람들이 만든 진지한 도구입니다.
하지만 그것들은 큰 회전 발전기에서 수동적 소비자로, 한 방향으로 흐르는 그리드를 위해 설계되었습니다. AI 기능은 그 문제보다 먼저 존재했던 SCADA 시스템 위에 얹힌 부가 기능입니다. 그리고 그것들이 수집하는 데이터는 압도적으로 송전 레벨의 것입니다 — 418kV를 가리키며 괜찮아 보였던 그 400kV 관점 말이죠. 사각지대는 이 플랫폼들의 버그가 아닙니다. 그것들이 어디를 보라고 지시받았는지의 결과입니다.
그다음에는 컨설팅 계층이 있습니다. McKinsey는 ERCOT의 상호연계 프로세스를 재설계하는 계약을 맺었고 텍사스 PUC의 2026년 2월 안건을 위해 "Batch Study" 프레임워크를 제출했습니다. 그것은 실질적인 작업입니다. 하지만 대형 컨설팅사들은 프로세스에 대해 자문할 뿐입니다 — 수백만 달러에 이르는 프로젝트에서 전략 자료와 벤더 평가를 제공하지만 — 물리 정보 기반 모델을 구축하지는 않습니다. "여기 더 나은 프로세스가 있습니다"와 "여기 당신의 대기열을 선별하는 작동하는 시스템이 있습니다" 사이의 간극, 바로 그곳이 우리가 일하는 지점입니다.
같은 사각지대가 곧 미국에 1,630억 달러의 비용을 초래할 것이다
이것이 유럽만의 이야기라고 생각한다면, PJM 용량 경매를 보십시오.
2025년 12월, 2027/2028 공급 연도를 대상으로 북미 최대 그리드 운영자인 PJM은 145,777MW를 조달했으나 예비율 목표에서 6,625MW가 부족했습니다. 전체 지역이 신뢰도 목표를 충족하지 못한 것은 처음이었습니다. 가격은 세 번 연속으로 경매 상한에 도달했습니다; 단일 경매 비용은 164억 달러였습니다. 2028년부터 2033년까지의 누적 용량 비용은 1,630억 달러로 예상됩니다. ComEd 지역만 놓고 보면 이는 주택용 요금 청구서에서 월 약 70달러에 해당합니다.
이제 관측성 이야기와 직접 연결되는 부분입니다: 그 부족분을 유발하는 5,250MW의 수요 증가 중 약 5,100MW가 데이터 센터입니다. 그 부하는 고르게 분산되어 있지 않습니다 — Dominion Virginia, AEP Ohio, ComEd Illinois의 특정 송전 구역에 집중되어 있습니다. 당신은 이베리아 정전 조건 — 핵심 변전소 주변의 국지적 스트레스 — 을 만들어 놓고, 그중 어느 하나도 피크 시간에 트립되지 않기를 바라고 있는 것입니다. 희망은 관측성 전략이 아닙니다.
그리고 이른바 안전밸브라는 신규 발전은 막혀 있습니다. 미국 상호연계 대기열은 2025년 약 2,600GW에 달했습니다. 중간값 프로젝트는 상업 운전에 도달하기까지 5년을 기다리며, 역사적으로 2000년에서 2018년 사이에 대기열에 진입한 프로젝트 중 실제로 건설된 것은 약 다섯 중 하나에 불과합니다. ERCOT의 대규모 부하 대기열만 해도 233GW에 이르렀는데 — 전년 대비 269% 급증했고, 그중 77%가 데이터 센터입니다 — 2025년에 동기화된 신규 발전은 겨우 23GW였습니다. FERC 자체 분석에 따르면 이를 해결하기 위한 클러스터 연구의 68%가 지연되어 완료되었습니다. GridLab은 상호연계 병목이 단일 용량 경매에서 PJM 소비자에게 35억 달러의 비용을 초래했다고 추정하는데, 낙찰되었어야 할 더 저렴한 발전이 제때 연결되지 못했기 때문입니다.
당신은 인간의 엔지니어링 시간으로 2,600GW의 대기열을 채용을 통해 뚫고 나갈 수 없습니다. 연구는 언제나 "지연 완료"라는 도장이 찍혀 돌아올 것입니다. 이것이 AI가 속하는 두 번째 자리입니다 — 그리드를 제어하는 것이 아니라, 인간이 구조적으로 따라갈 수 없는 속도로 대기열을 선별하고 군집화하는 것입니다.
동적 송전선 정격이 그렇게 저렴하다면, 왜 어디에나 있지 않은가?
세 번째 간극이 있는데, 이것은 저를 조금 미치게 만드는 것입니다. 그 기술이 이미 입증되었기 때문입니다.
동적 송전선 정격 — 송전선에 비접촉 센서를 부착해 보수적인 최악의 경우 가정 대신 실제 조건에 따라 용량을 정격화하는 것 — 은 실험적인 것이 아닙니다. LineVision이 지배적인 벤더입니다. 345kV 회랑에서 AES는 61%의 용량 증가를 보았습니다. National Grid의 Syracuse 배치는 20-30%를 추가했습니다. 그리고 그것은 전통적인 재도체(reconductoring) 프로젝트의 약 5-7% 비용이 듭니다 — AES 사례에서는 기존 업그레이드보다 약 76% 저렴했습니다.
그렇다면 왜 제약을 받는 모든 유틸리티가 그것으로 자사 네트워크를 뒤덮지 않았을까요? 하드웨어 벤더는 당신에게 센서를 팔지, 계획을 팔지 않기 때문입니다. 아무도 실제 계획 질문에 답하지 않습니다: 내 특정 네트워크가 주어졌을 때, 달러당 가장 많은 용량을 끌어내기 위해 그리드 강화 기술을 어디에, 그리고 언제 배치해야 하는가? 그것은 유틸리티 고유의 토폴로지와 부하 패턴에 걸친 최적화 문제입니다 — 그리고 그것은 센서 안이 아니라 센서 위에 얹히는 분석 계층입니다. FERC의 Order 1920은 이제 유틸리티가 고려하도록 요구합니다 — 새 송전선을 건설하기 전에 그리드 강화 기술을 말이죠. 이는 이 질문이 곧 수많은 계획 부서에 한꺼번에 떨어지게 된다는 뜻입니다.
동적 송전선 정격은 가장 저렴한 선택지이면서 동시에 가장 자주 활용되지 못하고 방치되는, 보기 드문 그리드 개입입니다.
AI가 그리드에서 실제로 속하는 곳

여러 갈래를 한데 모아 보면, 제 입장은 과대 광고보다 더 좁고, 제 생각에는 더 유용합니다.
AI는 안전이 중요한 그리드의 자율 제어에는 속하지 않습니다 — 오늘도 아니고, 엣지 케이스를 미묘하게 틀리는 모델의 힘으로도 아닙니다. AI는 현재의 소프트웨어 스택에 구조적 구멍이 있는 세 곳에 속합니다. 첫째, 수집(컬렉터) 레벨 관측성 — 400kV 모선이 평온해 보이는 동안 220kV 레벨에서 242kV를 포착했을 하위 송전 분석 말입니다. 둘째, 대기열 인텔리전스 — 지연 완료되는 클러스터 연구가 결코 해내지 못할 속도로 2,600GW 규모의 상호연계 요청을 선별하고 군집화하는 것 말입니다. 셋째, 그리드 강화 기술 최적화 계층 — 동적 송전선 정격과 전력 조류 제어가 실제로 성과를 내는 지점을 계획자에게 알려 주는 것입니다. 이 세 가지 모두의 밑바탕에서, 물리 정보 기반 모델은 계획 연구를 위한 자문 및 시뮬레이션 도구로서 제 몫을 합니다 — 레거시 도구보다 극적으로 빠르고, 펜은 여전히 운영자가 쥐고 있습니다.
사람들은 저에게 유틸리티가 정말로 또 하나의 벤더를 원하는지 묻습니다. 그들은 원하지 않고, 우리도 그들에게 그런 벤더가 되어 달라고 요구하지 않습니다. 유틸리티에는 뜯어내지 않을 GE, Siemens, ABB SCADA 시스템이 있습니다. 그들에게 필요한 것은 함께 설치 기반과 작동하는, 벤더 중립적인 AI 오버레이입니다 — 교체를 요구하는 또 하나의 모놀리스가 아니라 말이죠. 그것은 의도적인 설계 선택이며, 이는 솔루션 페이지에 자세히 나와 있습니다.
사람들은 규제의 누적에 대해서도 묻는데, 그것은 실재합니다. EU AI 법은 그리드 관리에서의 AI를 고위험으로 분류하며, 준수 기한은 2026년 8월 2일이고 벌금은 최대 1,500만 유로 또는 글로벌 매출의 3%에 이릅니다. NERC의 CIP-003-9는 2026년 4월에 발효됩니다. FERC Order 1920의 그리드 강화 기술 요건은 지금 도래하고 있습니다. 정전에 대한 스페인의 대응 — Red Eléctrica가 P.O. 7.4에 따라 24개 재생에너지 설비에 동적 전압 제어를 승인하고, 이들에게 ±30%의 무효 전력 성능을 입증하도록 요구한 것 — 은 실제로 검증하고 운영하기 위해 새로운 분석을 필요로 하는 바로 그런 종류의 의무입니다. 여기서 준수와 역량은 별개의 프로젝트가 아닙니다. 당신을 합법 상태로 유지해 주는 것이 곧 당신의 불을 켜진 상태로 유지해 주는 것과 같은 것입니다.
이베리아 보고서는 그리드가 눈이 먼 순간을 정확히 명명함으로써 한 장(章)을 닫았습니다. 저는 그 안에서 재생에너지에 관한 논쟁을 읽지 않습니다. 저는 잘못된 곳을 가리킨 계기를 읽습니다. 올바른 곳을 가리키는 계기를 만드는 것 — 그것이 바로 그 일입니다.


