대부분의 기업 데이터는 복잡하지 않습니다. 다만 관리가 제대로 되어 있지 않을 뿐입니다.
조직들이 데이터 환경을 복잡하다고 표현할 때, 실제로 의미하는 바는 더 정확합니다. 데이터는 공유를 고려하지 않고 설계된 시스템 곳곳에 축적되어 있고, 더 이상 사용되지 않는 애플리케이션에는 현재 팀이 접해본 적 없는 형식으로 수십 년간의 비즈니스 기록이 저장되어 있으며, 메타데이터는 스프레드시트나 더 이상 근무하지 않는 엔지니어의 기억 속에만 존재하고, 모든 AI 프로젝트는 첫 번째 모델을 학습시키기까지 수개월간의 데이터 엔지니어링 과정을 거쳐야 한다는 것입니다.
그것은 복잡성이 아닙니다. 바로 거버넌스의 부재입니다. 이 차이가 중요한 이유는 복잡성은 문제가 아키텍처적인 문제, 즉 새로운 플랫폼, 새로운 투자, 새로운 인프라를 필요로 한다는 것을 의미하기 때문입니다. 반면, 관리되지 않는 데이터는 구조적인 문제입니다. 데이터가 도착하는 순간부터 일련의 의사 결정을 통해 해결할 수 있는 문제입니다.
세 단계, 하나의 순서
방대한 데이터 더미에서 AI 활용 가능한 자산으로 전환하는 과정은 임시 데이터, 관리 데이터, 최적화 데이터의 세 단계를 거칩니다. 대부분의 기업은 실제보다 이 단계를 더 많이 진행했다고 생각합니다. 진단은 간단합니다. AI 프로젝트를 위해 첫 번째 모델을 학습시키기 전에 수개월 동안 데이터 엔지니어링 작업을 해야 한다면, 해당 데이터는 임시 데이터입니다. AI 출력물의 출처를 추적할 수 없다면, 시맨틱 레이어가 부족한 것입니다. "누가 이 데이터를 조회할 수 있습니까?"라는 질문에 "티켓이 접수된 후 데이터 팀에서 조회할 수 있습니다."라고 답한다면, 최적화 단계에 도달하지 못한 것입니다.
세 단계는 연속적인 스펙트럼이 아니라 순차적인 과정입니다. 관리 단계는 최적화 단계의 필수 조건입니다. 최적화 상태에 가장 빠르게 도달하는 조직은 각 단계를 의도적인 설계 결정으로 여긴 조직이며, 우연히 축적되는 결과로 생각하지 않는 조직입니다.
1단계: 임시 저장소 — 대부분의 기업 데이터가 존재하는 곳
임시 단계에서는 데이터가 존재하지만 신뢰할 수 있게 사용할 수 없습니다. 이러한 데이터는 트랜잭션 처리를 위해 구축된 스토리지 시스템에 저장됩니다. 더 이상 사용되지 않는 애플리케이션에는 재무 기록, 구매 데이터, 고객 거래 내역 등 수년 또는 수십 년에 걸친 비즈니스 역사가 저장되어 있지만, 해당 데이터에 대한 맥락을 제공했던 애플리케이션은 이미 폐기된 상태입니다. 남아 있는 데이터는 종종 모호합니다. 원래 개발자에게 의미 있는 테이블 이름, 다른 시대에 작성된 소프트웨어에서 물려받은 열 규칙, 데이터베이스 스키마가 아닌 애플리케이션 로직에 인코딩된 관계 등이 그 예입니다.
모든 AI 프로젝트는 시작 단계에서부터 비용을 지불해야 합니다. 데이터 엔지니어링 팀은 각 프로젝트마다 맞춤형 데이터 수집 파이프라인을 구축합니다. 품질 검사는 일관성이 없거나 아예 이루어지지 않습니다. 데이터 보존 정책, 접근 제어, 분류 체계와 같은 거버넌스는 어딘가에 문서화되어 있지만, 데이터가 실제로 저장되는 시스템에서는 제대로 시행되지 않습니다. 각 프로젝트는 동일한 기반을 재구축하는 과정을 반복합니다. 첫 번째 모델 학습에 필요한 데이터가 준비되지 않았기 때문에 AI 투자에 대한 사업 타당성은 첫 번째 모델 학습 전에 이미 약화됩니다.
2단계: 관리형 - 정보 수집에 앞서 거버넌스
관리 단계는 데이터 수집 시점부터 시작됩니다. 데이터는 보존 정책이 첫 바이트부터 적용되는 관리 환경에 도착하며, 하위 시스템에 도달하기 전에 품질 검사가 실행되고, 조직의 자체 분류 체계에 따라 레코드가 분류 태그로 지정되며, 데이터가 도착하는 순간부터 법적 보존 기능이 활성화됩니다. 이는 단순한 스토리지 업그레이드가 아닙니다. 데이터 수신 방식의 구조적 변화, 즉 단일 정책 모델 하에서 사용 중단된 애플리케이션, 인수된 시스템, 활성 운영 환경의 데이터를 위한 관리되고 중앙 집중화된 저장소를 제공하는 보존 영역 아키텍처입니다.
집행 계층은 거버넌스 플랫폼에 있습니다. 실시간으로 데이터 보존이 적용되고, 접근 시 데이터 마스킹이 강제되며, 모든 거버넌스 활동은 변경 불가능한 감사 추적 기록에 저장됩니다. 관리 단계에서는 AI 결과물을 생성하지 않습니다. 대신, 분류, 검증, 관리되고 법적으로 방어 가능한, 신뢰할 수 있는 데이터를 생성합니다. 이 단계에 도달한 조직은 규정 준수 문제를 해결한 것입니다. 하지만 의미 부여 문제는 아직 해결하지 못했습니다.
3단계: 최적화 - 데이터가 연료가 되는 단계
관리되는 데이터는 의미론적 계층이 추가될 때 AI 처리 준비가 완료됩니다. 대부분의 범용 플랫폼은 이러한 전환 과정을 생략하며, AI가 검증된 비즈니스 의미를 기반으로 작동하는지 아니면 추론된 스키마를 기반으로 작동하는지를 결정하는 핵심 요소입니다. 데이터베이스 스키마는 어떤 필드가 존재하는지만 정의합니다. 하지만 필드가 무엇을 나타내는지, 비즈니스 운영에 필요한 가치 흐름 전반에 걸쳐 필드들이 어떻게 연관되는지, 또는 해당 애플리케이션 컨텍스트에서 유효한 쿼리 패턴이 무엇인지는 명시하지 않습니다. AI 시스템이 원시 스키마를 기반으로 추론하는 것은 추측에 불과합니다. 이러한 방식으로 생성된 답변은 설명, 추적, 또는 비즈니스 의사 결정에 있어 신뢰할 수 있는 근거가 될 수 없습니다.
애플리케이션 지식 그래프는 기업 애플리케이션에 특화된 비즈니스 객체, 관계, 어휘 및 검증된 쿼리 패턴을 인코딩하여 이러한 격차를 해소합니다. Solix는 Oracle EBS , SAP ECC/S4HANA , PeopleSoft 및 JD Edwards 와 같은 기업 정형 데이터의 대부분을 보유하는 ERP 시스템 용으로 사전 구축된 애플리케이션 지식 그래프를 제공하며 , 사전 구축된 지식 그래프가 없는 기존 및 인수된 애플리케이션에 대해서는 AI 기반 검색을 통해 맞춤형 지식 그래프를 구축합니다. 비정형 콘텐츠의 경우, 콘텐츠 인텔리전스는 문서, 계약 및 기록 위에 의미론적 계층을 구축하여 단일 관리 인터페이스에서 정형 데이터와 함께 쿼리할 수 있도록 합니다.
시맨틱 레이어가 구축되면 비즈니스 사용자는 자연어로 질문하고 인증된 비즈니스 정의에 기반한 관리되고 감사 가능한 답변을 받을 수 있습니다. 데이터 과학 팀은 이미 관리되고 분류되고 의미론적으로 풍부해진 기반 위에 AI 애플리케이션을 구축할 수 있습니다. 더 이상 처음부터 준비되어 있어야 할 데이터를 준비하는 데 몇 달씩 허비할 필요가 없습니다. 보존된 데이터는 더 이상 인프라 비용이 아니라 Solix 엔터프라이즈 데이터 보존 백서 의 표현처럼 "지능형 분석, 발견 및 의사 결정을 위한 연료"가 됩니다.
진단이지, 흡인이 아닙니다.
성숙도 모델은 정직하게 적용될 때만 유용합니다. 세 가지 질문을 통해 조직의 실제 위치를 파악할 수 있습니다.
데이터가 첫 바이트부터 분류, 품질 검증, 보존 규정 준수 등의 관리 체계를 거쳐 통제된 환경에 도착하는지, 아니면 규정 준수 문제가 발생했을 때 사후적으로 관리 체계가 적용되는지를 확인해야 합니다. 첫 번째 질문에 답할 수 없는 조직은 그 위에 배포되는 모든 AI 애플리케이션이 증가함에 따라 위험도 함께 커지게 됩니다.
조직에서 운영하는 애플리케이션에 비즈니스 의미를 인코딩하는 시맨틱 레이어가 존재합니까, 아니면 AI 시스템이 원시 스키마를 기반으로 추론하고 컨텍스트를 파악하지 못한 채 분석하고 있습니까? 시맨틱 레이어가 없다면 AI 출력물을 신뢰할 수 있게 추적, 설명 또는 제시할 수 없습니다.
비즈니스 사용자가 인증된 정의에 기반하고 출처를 추적할 수 있는 답변을 자연어로 직접 검색할 수 있습니까? 아니면 모든 질문에 여전히 데이터 팀과 티켓 대기열이 필요합니까?
각 질문에 대한 '아니오'와 '예' 사이의 거리는 임시방편적인 접근 방식과 인공지능 기반 접근 방식 사이의 거리입니다. 이는 극복 가능한 거리이지만, 순차적으로만 가능하며, 각 단계를 과거의 결과가 아닌 의도적인 결정으로 간주할 때에만 가능합니다.
면책 조항: 본 블로그에 표현된 콘텐츠, 견해 및 의견은 전적으로 작성자의 것이며, SOLIX TECHNOLOGIES, INC., 그 계열사 또는 파트너의 공식 정책이나 입장을 반영하는 것이 아닙니다. 본 블로그는 독립적으로 운영되며, SOLIX TECHNOLOGIES, INC.가 공식적인 자격으로 검토하거나 보증하지 않습니다. 본 블로그에 언급된 모든 제107자 상표, 로고 및 저작권 자료는 해당 소유자의 재산입니다. 모든 사용은 공정 사용 원칙(미국 저작권법 제1조 및 이에 상응하는 국제법)에 따라 식별, 논평 또는 교육적 목적으로만 엄격히 제한됩니다. SOLIX TECHNOLOGIES, INC.와의 후원, 보증 또는 제휴 관계는 묵시적으로 허용되지 않습니다. 콘텐츠는 정확성, 완전성 또는 어떠한 목적에의 적합성에 대한 보증 없이 "있는 그대로" 제공됩니다. SOLIX TECHNOLOGIES, INC.는 이 자료를 기반으로 취한 조치에 대해 어떠한 책임도 지지 않습니다. 독자는 이 정보의 사용에 대한 전적인 책임을 집니다. SOLIX는 지적 재산권을 존중합니다. DMCA 삭제 요청을 제출하려면 INFO@SOLIX.COM으로 (2) 저작물 식별 정보, (3) 침해 자료의 URL, (4) 귀하의 연락처 정보, (XNUMX) 성실한 태도에 대한 진술을 포함한 이메일을 보내주십시오. 유효한 신고는 즉시 처리됩니다. 이 블로그에 접속함으로써 귀하는 본 면책 조항 및 이용 약관에 동의하는 것으로 간주됩니다. 본 계약은 캘리포니아 법률의 적용을 받습니다.