스티븐 탈란트

대부분의 AI 프로그램이 나누지 않는 대화

AI 파일럿 단계에서 AI 프로그램 단계로 넘어가는 조직들은 공통적인 패턴을 보입니다. 바로 규모가 커지기 전에 아키텍처 문제를 해결했다는 점입니다. 즉, 두 번째 또는 세 번째 프로덕션 애플리케이션을 배포하기 전에 스토리지 속성, 시맨틱 레이어, 파이프라인 제어 측면에서 데이터 기반이 어떤 모습이어야 하는지 정의했습니다.

대부분은 이러한 순서를 따르지 않습니다. 모델을 선택하고, 사용 사례를 정의하고, 개념 증명을 구축한 후, 데이터 기반 구축은 프로그램이 성장함에 따라 해결될 문제로 간주합니다. 기업 환경에서 이러한 가정은 결국 규모 확장을 시도할 때 지연과 비용 증가의 주요 원인이 됩니다.

접근성이 좋다는 것이 AI 활용 준비가 되었다는 의미는 아닙니다.

초기 AI 프로그램 기획에서 흔히 간과되는 점은 접근 가능한 데이터와 AI에서 활용할 준비가 된 데이터 사이의 차이점입니다.

접근 가능한 데이터는 쿼리할 수 있습니다 . 시스템에 존재하고, 추출할 수 있으며, 모델이 참조할 수 있습니다. 대부분의 기업 데이터는 이러한 기준을 충족합니다. AI 활용 준비가 된 데이터는 수집 시점부터 관리되고, 검증된 의미론적 의미를 가지며, 모델에 도달하기 전에 품질 검증을 거쳤고, 데이터 계보에 공백 없이 출처에서 결과까지 추적할 수 있습니다.

이 두 정의 사이의 차이는 데이터 품질 프로젝트가 아니라 아키텍처적인 문제입니다. 엔터프라이즈 AI가 요구하는 규모에서는 데이터를 사후적으로 관리하는 것이 불가능합니다. 엔터프라이즈 AI의 확장성을 결정하는 세 가지 계층, 즉 스토리지, 메타데이터, 파이프라인은 각각 고유한 역할을 수행하며, 각 계층이 의존하는 조건을 조성합니다.

기초 공사가 항상 마지막에 이루어지는 이유

대부분의 기업 데이터 환경은 인공지능(AI)을 염두에 두고 설계되지 않았습니다. 데이터는 트랜잭션 처리를 위해 구축된 스토리지 시스템에 저장됩니다. 메타데이터는 존재하더라도 스프레드시트에 기록되거나 데이터 사전 속에 묻혀 있거나, 최초 시스템을 구축한 엔지니어들의 머릿속에만 남아 있는 경우가 많습니다. 파이프라인은 일회성 구축물에 불과하며, 대규모 AI 애플리케이션 운영에 필요한 데이터를 처리하도록 설계된 적이 없습니다.

결과적으로 모든 AI 프로젝트는 데이터 계층에서 사실상 처음부터 다시 시작해야 합니다. 품질 검사는 일관성 없이 적용되고, 거버넌스는 사후에 추가되는 경우가 많습니다. 일반적인 머신러닝 플랫폼은 모델 개발 도구는 제공하지만, 실제 기업 데이터에서 해당 도구를 안정적으로 사용할 수 있도록 하는 관리형 데이터 수집, 시맨틱 계층 또는 프로덕션 수준의 품질 관리 기능은 제공하지 않습니다. 고객은 이러한 계층을 직접 구축해야 하므로 AI 프로젝트는 초기 사업 계획에서 예상했던 것보다 훨씬 오래 걸리고 비용도 더 많이 듭니다.

세 가지 계층, 세 가지 뚜렷한 역할

스토리지 계층은 거버넌스가 시작되거나 영구적으로 연기되는 지점입니다. ACID 트랜잭션 , 스키마 진화, 타임 트래블 쿼리는 성능 향상을 위한 기능이 아니라 필수적인 거버넌스 요구 사항입니다. 스키마 진화는 기업 소스 시스템이 지속적으로 변화하기 때문에 중요합니다. 이러한 변화를 수용할 수 없는 스토리지 계층은 상위의 모든 AI 프로젝트에 병목 현상을 초래합니다. 타임 트래블 쿼리를 통해 규제 대상 기업은 수동 데이터 재구성 없이 과거 감사 질문에 대한 답변을 얻을 수 있습니다. 데이터 수집 시점에 보존 정책을 시행하면 대부분의 조직이 아키텍처가 아닌 프로세스와 문서화를 통해 관리하는 규정 준수 위험을 완전히 제거할 수 있습니다. Solix는 Apache Hudi 기반의 관리형 레이크하우스와 기업 애플리케이션 데이터 전용 보존 영역을 통해 이러한 기능을 제공하며, 데이터가 도착하는 순간부터 보존 및 법적 보류 기능을 활성화합니다.

메타데이터 계층은 데이터가 의미를 획득하는 곳이자 대부분의 엔터프라이즈 AI 기반이 가장 취약한 부분이기도 합니다. 데이터베이스 스키마는 어떤 필드가 존재하는지만 알려줄 뿐, 필드가 무엇을 나타내는지 또는 애플리케이션 간에 어떤 관계가 있는지는 알려주지 않습니다. AI 시스템이 원시 스키마를 기반으로 추론할 경우, AI가 알지 못하는 비즈니스 의미를 추론하게 되어 출처를 설명하거나 추적할 수 없는 결과를 도출하게 됩니다. 애플리케이션 지식 그래프(APKG)는 이러한 격차를 해소합니다. APKG는 엔터프라이즈 애플리케이션에 특화된 비즈니스 객체, 관계, 어휘, 그리고 검증된 쿼리 패턴을 인코딩하는 시맨틱 계층입니다. Solix는 Oracle EBS , SAP ECC/S4HANA , PeopleSoft , JD Edwards 용으로 사전 구축된 APKG를 제공하여 고객이 시맨틱 구축 과정에서 가장 많은 시간을 소모하는 부분을 해결해 줍니다. 비정형 콘텐츠의 경우에도 데이터 수집 시 구축되는 시맨틱 인덱스는 동일한 원칙을 적용합니다. 즉, 모델이 추론하기 전에 의미가 인코딩됩니다. 결과적으로, AI가 도출한 답변은 인증된 비즈니스 정의로 추적할 수 있으며, 규제 기관이나 이사회에 자신 있게 제시할 수 있습니다.

파이프라인 계층은 모든 하위 AI 출력의 신뢰성을 결정하는 단계입니다. 자동 프로파일링, 품질 규칙, 데이터 계보 추적 및 데이터 준비 워크플로를 통해 문제가 데이터 수집 단계에서 발견되도록 보장하며, 잘못된 AI 권장 사항이 비즈니스 의사 결정에 이미 영향을 미친 후 문제를 해결하는 것을 방지합니다. Solix는 이를 수집, 관리형 레이크하우스, 데이터 품질 및 머신러닝 흐름의 네 가지 순차적인 관리 단계로 구성하며, 각 단계는 감사가 가능하고 데이터가 도착한 시점부터 AI를 위한 프로덕션 준비 상태가 될 때까지 걸리는 시간을 단축합니다.

실제 사용에 적합한 기반은 어떤 모습일까요?

금융 서비스 기업이 Oracle EBS 및 SAP 데이터를 실시간 운영 피드와 더 이상 사용되지 않는 애플리케이션의 아카이브 기록과 함께 통합한다고 가정해 보겠습니다. 목표는 비즈니스 사용자를 위한 자연어 접근 기능을 갖춘 AI 기반 위험 및 운영 인텔리전스 플랫폼과 데이터 과학 팀을 위한 관리 기반을 구축하는 것입니다.

스토리지 계층에서 데이터는 ACID 트랜잭션 , 스키마 진화, 규제 관련 과거 데이터 조회를 위한 타임 트래블 쿼리 기능을 갖춘 관리형 레이크하우스에 저장됩니다. 레거시 애플리케이션 데이터는 보존 관리가 적용되고 법적 보존 조치가 가능한 관리형 보존 영역 으로 이동합니다.

메타데이터 계층에서는 Oracle EBS 및 SAP용으로 사전 구축된 애플리케이션 지식 그래프가 조직의 특정 설정에 맞게 구성되어 구매-지불, 주문-현금화 및 기록-보고 가치 흐름을 인코딩합니다. 통합 자산 카탈로그는 전체 자산에 걸쳐 인증된 비즈니스 정의와 계보를 유지 관리합니다. 비즈니스 분석가가 자연어로 질의하거나 위험 모델이 데이터를 분석할 때, 답변은 원시 테이블에서 추론한 것이 아니라 인증된 정의를 기반으로 합니다.

파이프라인 계층에서 품질 규칙은 데이터가 모델에 도달하기 전에 적용됩니다. 데이터 계보는 소스부터 AI 기반 제품에 이르기까지 모든 요소를 ​​추적합니다. 데이터 과학 팀은 관리된 데이터를 기반으로 작업을 수행하며, 첫 번째 모델을 학습시키기 전에 수개월에 걸쳐 맞춤형 데이터 엔지니어링 작업을 진행할 필요가 없습니다.

차세대 AI 프로젝트가 확대되기 전에 제기해야 할 세 가지 질문

AI 투자 다음 단계로 넘어가기 전에 데이터 아키텍처에 대한 세 가지 질문을 팀에 직접 던져보는 것이 좋습니다.

데이터는 첫 바이트부터 품질 검증, 보존 정책 및 감사 추적이 적용되는 관리 환경에 저장됩니까, 아니면 문제가 발생한 후에 사후적으로 관리가 적용됩니까? 첫 번째 질문에 답할 수 없는 조직은 그 위에 배포되는 모든 AI 애플리케이션마다 증가하는 규정 준수 위험에 직면하게 됩니다.

해당 데이터를 처리하는 AI 시스템에 비즈니스 의미를 인코딩하는 시맨틱 레이어가 있습니까, 아니면 원시 스키마를 직접 기반으로 추론합니까? 시맨틱 레이어가 없다면 AI 출력물을 신뢰할 수 있게 추적, 설명 또는 방어할 수 없습니다.

AI 모델에 데이터를 제공하는 파이프라인은 관리되고 이력 추적이 가능한 데이터 제품을 생산하는가, 아니면 각 새로운 프로젝트가 독립적으로 재설계해야 하는 원시 입력값을 생산하는가? 후자의 경우, 데이터 엔지니어링 비용을 재단 차원에서 한 번만 지불하는 것이 아니라 프로젝트별로 반복적으로 지불해야 한다는 의미이다.

만약 이러한 질문들 중 어느 하나라도 예상보다 답변하기 어렵다면, 바로 그 지점에서 아키텍처 검토가 시작되고, 확장 가능한 엔터프라이즈 AI를 위한 청사진이 탄생하게 됩니다.

스티븐 탈란트

스티븐 탈란트

제품 마케팅 부사장

솔릭스 테크놀로지스(Solix Technologies)의 제품 마케팅 부사장으로서, 저는 제품 및 솔루션 스토리를 시장에 효과적으로 전달하고 개발하는 업무를 총괄하고 있습니다. 25년 이상 제품 마케팅 및 제품 관리 분야에서 다양한 소프트웨어 솔루션을 위한 매력적인 메시지, 출시 계획, 홍보 자료 및 콘텐츠를 제작해 온 경험을 가지고 있습니다. 저는 필라델피아 광역권에 거주하며 열렬한 스포츠 팬으로서 필라델피아 스포츠 명예의 전당 이사회 위원으로 활동하고 있습니다. 학부와 대학원 모두 빌라노바 대학교(Villanova University)에서 취득했습니다.

면책 조항: 본 블로그에 표현된 콘텐츠, 견해 및 의견은 전적으로 작성자의 것이며, SOLIX TECHNOLOGIES, INC., 그 계열사 또는 파트너의 공식 정책이나 입장을 반영하는 것이 아닙니다. 본 블로그는 독립적으로 운영되며, SOLIX TECHNOLOGIES, INC.가 공식적인 자격으로 검토하거나 보증하지 않습니다. 본 블로그에 언급된 모든 제107자 상표, 로고 및 저작권 자료는 해당 소유자의 재산입니다. 모든 사용은 공정 사용 원칙(미국 저작권법 제1조 및 이에 상응하는 국제법)에 따라 식별, 논평 또는 교육적 목적으로만 엄격히 제한됩니다. SOLIX TECHNOLOGIES, INC.와의 후원, 보증 또는 제휴 관계는 묵시적으로 허용되지 않습니다. 콘텐츠는 정확성, 완전성 또는 어떠한 목적에의 적합성에 대한 보증 없이 "있는 그대로" 제공됩니다. SOLIX TECHNOLOGIES, INC.는 이 자료를 기반으로 취한 조치에 대해 어떠한 책임도 지지 않습니다. 독자는 이 정보의 사용에 대한 전적인 책임을 집니다. SOLIX는 지적 재산권을 존중합니다. DMCA 삭제 요청을 제출하려면 INFO@SOLIX.COM으로 (2) 저작물 식별 정보, (3) 침해 자료의 URL, (4) 귀하의 연락처 정보, (XNUMX) 성실한 태도에 대한 진술을 포함한 이메일을 보내주십시오. 유효한 신고는 즉시 처리됩니다. 이 블로그에 접속함으로써 귀하는 본 면책 조항 및 이용 약관에 동의하는 것으로 간주됩니다. 본 계약은 캘리포니아 법률의 적용을 받습니다.