Skip to main content

온톨로지 시스템 제안

한국수목원정원관리원 콘텐츠 생성 플랫폼 온톨로지 구축 시스템

식물 데이터베이스를 단순 조회형 자산에서 지능형 콘텐츠 생성 자산으로 전환합니다. 식물 DB를 콘텐츠 생성 목적에 맞게 의미 구조화한 뒤, 생성형 AI가 그 구조를 근거로 정확하고 일관성 있는 콘텐츠를 생성하도록 하는 지식 구조화 사업입니다.

  • 의미 구조화
  • 반자동 온톨로지 구축
  • 공개 표준 연계
  • 전문가 검수 거버넌스
  • 근거 기반 생성

01

사업 개요

사업명

한국수목원정원관리원 콘텐츠 생성 플랫폼 온톨로지 구축 시스템

핵심 목적

기관 보유 식물 DB를 생성형 AI가 활용 가능한 지식 기반으로 전환합니다.

결과 방향

도감, 전시 해설, 교육 콘텐츠, 추천 코스, 오디오가이드까지 확장합니다.

이 사업의 핵심은 “식물 DB를 LLM에 넣는 것”이 아니라, 콘텐츠 생성 목적에 맞게 의미 구조를 먼저 설계하는 것입니다.

식물 분류, 보유 식물, 전시원, 생육, 사진, 교육, 해설, 관람 정보를 온톨로지 기반으로 연결해 생성형 AI가 신뢰 가능한 근거 위에서 콘텐츠를 만들도록 합니다.

  1. 1기관 보유 식물 DB
  2. 2LLM 기반 온톨로지 후보 추출
  3. 3후보 병합·정규화
  4. 4공개 표준 온톨로지와 매핑
  5. 5전문가 검수 및 확정
  6. 6기관 특화·콘텐츠 생성용 온톨로지 구축
  7. 7생성형 AI 콘텐츠 플랫폼 연계

02

추진 배경 및 필요성

기존 식물 DB의 한계

  • 개화시기, 전시위치, 교육 활용성, 관람 동선이 의미적으로 연결되어 있지 않습니다.
  • 식물 종 정보와 수목원 내 실제 보유 개체 정보가 혼재될 수 있습니다.
  • 도감, 해설, 교육, 추천 코스 등 콘텐츠 유형별 관점이 구조에 반영되어 있지 않습니다.
  • AI가 DB를 직접 참조하면 공식 정보와 추론 정보를 혼동할 위험이 있습니다.

온톨로지 기반 접근의 역할

  • 식물 데이터의 개념, 관계, 속성, 제약, 사용 맥락을 명시적으로 구조화합니다.
  • Taxon, Accession, Individual, Occurrence를 구분해 생성 오류를 줄입니다.
  • 도감·전시·교육·추천 콘텐츠 생성을 위한 공통 지식 기반을 제공합니다.
  • 생성 결과의 출처, 근거, 검수 이력, 모델 버전을 추적할 수 있습니다.

03

사업 목표

정성 목표

  1. 1기관 보유 식물 DB를 콘텐츠 생성 목적에 맞게 의미 구조화합니다.
  2. 2식물학적 정확성과 콘텐츠 활용성을 동시에 만족하는 온톨로지 체계를 구축합니다.
  3. 3생성형 AI가 도감, 전시 해설, 교육 콘텐츠, 추천 코스를 안정적으로 생성하도록 합니다.
  4. 4콘텐츠 생성 결과의 근거, 출처, 검수 이력, 버전을 추적합니다.
  5. 5외부 생물다양성 데이터와 수목원·정원 데이터 연계를 고려한 확장형 구조를 마련합니다.

정량 목표

보유 식물 DB 전체 후보 추출식물 공통 도메인 개념 체계목적별 응용 온톨로지속성·관계 후보 정규화competency question콘텐츠 템플릿출력 스키마검증 규칙

04

구축 범위

주요 데이터 범위

식물 분류 정보
식물 형태 정보
생육·계절 정보
서식지·생태 정보
보유·전시 정보
교육·해설 정보
미디어 정보
주의·위험 정보

생성 대상 콘텐츠

도감형 식물 설명전시 해설문어린이·청소년 교육 콘텐츠교사용 활동지관람객 맞춤 추천 코스계절별 추천 식물 콘텐츠SNS 카드뉴스 문안오디오가이드 스크립트식물 퀴즈전시 패널 문안보도자료·홍보문 초안

05

온톨로지 구축 기본 원칙

반자동 구축

LLM은 후보를 추출하고, 최종 확정은 전문가가 수행합니다. AI를 확정자가 아니라 반복 작업 자동화 도구로 사용합니다.

공통 코어와 모듈 분리

하나의 거대한 온톨로지가 아니라 식물 공통 도메인과 도감·전시·교육·추천 모듈을 분리합니다.

공개 표준 연계

BFO, Darwin Core, Plant Ontology, ENVO, SKOS, PROV-O와 연결 가능한 구조로 설계합니다.

Taxon, Accession, Individual, Occurrence의 분리

Taxon

분류학적 개념. 특정 식물 종, 과, 속, 학명.

Accession

기관이 도입·관리하는 수집 단위.

Individual

실제로 전시원에 식재된 보유 식물 개체.

Occurrence

특정 시점·장소에서 관찰·기록된 사건.

06

온톨로지 구조 설계

상위 정렬 코어

Object

식물 개체표본사진문서전시원

Process

개화결실관찰전시콘텐츠 생성

Quality

꽃 색잎 모양향기크기생육 상태

Role

전시식물교육활용식물추천식물보전대상식물

Site

수목원정원전시원구역관람 동선

InformationContent

해설문사진오디오가이드활동지SNS 문안

식물 공통 도메인 온톨로지

PlantTaxonPlantAccessionManagedPlantIndividualPlantTraitPhenologicalStateHabitatExhibitionZoneMediaAsset

목적별 응용 온톨로지

  1. 1도감 콘텐츠 모듈: 식별·분류·형태·생태
  2. 2전시 해설 모듈: 관람 경험·전시 공간·계절성
  3. 3교육 콘텐츠 모듈: 연령·학습 목표·관찰 활동
  4. 4추천 코스 모듈: 관람객 유형·동선·소요 시간

07

구축 방법론

10단계 추진 절차

  1. 1콘텐츠 생성 사용 사례 정의
  2. 2식물 DB 필드 분석 및 데이터 프로파일링
  3. 3샘플 데이터 선정
  4. 4LLM 후보 추출 스키마 설계
  5. 5샘플 기반 후보 추출 실험
  6. 6전체 DB 대상 후보 추출
  7. 7후보 병합·정규화
  8. 8공개 표준 온톨로지 매핑
  9. 9전문가 검수 및 온톨로지 확정
  10. 10생성형 AI 콘텐츠 플랫폼 연계

후보 추출 스키마의 핵심

  • 공통 도메인, 도감, 전시 해설, 교육, 추천 코스 후보를 분리합니다.
  • Darwin Core, Plant Ontology, ENVO, SKOS, PROV-O 표준 매핑 후보를 포함합니다.
  • 위험 플래그, 근거 필드, 근거 문장, 신뢰도, 전문가 검수 필요 여부를 함께 저장합니다.

후보 병합·정규화 예시

“봄꽃”, “봄철 개화식물”, “봄에 피는 식물”, “SpringFloweringPlant”를 하나의 대표 개념으로 묶고, 한국어 라벨·대체 라벨·상위 개념·판정 기준·활용 모듈을 정리합니다.

08

시스템 구성안

논리 아키텍처

  1. 1원천 데이터 계층: 식물 DB, 전시원 DB, 사진 DB, 교육·해설 자료
  2. 2데이터 정제·프로파일링 계층: 필드 분석, 누락 탐지, 표준화
  3. 3LLM 후보 추출 계층: 개념·속성·관계·질문·태그 후보
  4. 4후보 관리 계층: 후보 저장소, 병합, 정규화, 근거 관리
  5. 5온톨로지 관리 계층: 도메인 온톨로지, 응용 온톨로지, SKOS 어휘
  6. 6전문가 검수 계층: 승인, 수정, 폐기, 버전 관리
  7. 7생성형 AI 콘텐츠 계층: RAG, 프롬프트, 콘텐츠 생성, 검증
  8. 8서비스 계층: 도감, 전시 해설, 교육 콘텐츠, 추천 코스, SNS, 오디오가이드

데이터 프로파일링

누락률, 표기 흔들림, 전시원명 표준화 후보, 개화시기 형식 정규화

LLM 후보 추출

레코드 단위 후보, 콘텐츠 목적별 후보, 질문 후보, 표준 매핑 후보

후보 병합·정규화

유사 개념 클러스터링, 대표 라벨, 대체 라벨, 검수 우선순위

전문가 검수

역할별 큐, 위험 정보 우선 검수, 표준 매핑 검수, 이력 기록

콘텐츠 생성

도감형 설명, 전시 해설, 교육 활동지, 퀴즈, 추천 코스

콘텐츠 검증

학명·국명 일치, 전시 위치, 개화 정보, 위험 표현, 출처 포함 여부

09

LLM 활용 전략

LLM의 역할

온톨로지 후보 추출기콘텐츠 질문 생성기후보 정규화 보조기표준 매핑 제안기콘텐츠 생성기콘텐츠 검증 보조기

후보 추출 프롬프트 원칙

  • DB에 명시된 정보와 LLM 추론 정보를 구분합니다.
  • 식물 종 일반 정보와 수목원 보유 개체 정보를 섞지 않습니다.
  • 독성, 약용, 식용, 치료 효과는 반드시 위험 플래그로 표시합니다.
  • 클래스, 속성, 태그, 규칙 후보를 구분하고 근거 필드와 신뢰도를 붙입니다.

LLM은 최종 온톨로지 확정자가 아닙니다. 최종 확정은 전문가와 기관 담당자의 검수를 거친 후보만 정식 온톨로지로 승격하는 방식으로 운영합니다.

10

전문가 검수 및 거버넌스

검수 그룹

  • 식물분류·생태 전문가: 학명, 분류, 형태, 서식지, 유사종, 독성 검수
  • 전시·수목원 운영 담당자: 전시원, 동선, 계절 하이라이트, 관람 포인트 검수
  • 교육 담당자: 학습 목표, 연령 적합성, 활동 난이도, 안전 안내 검수
  • 콘텐츠·홍보 담당자: 문체, SNS 적합성, 공공기관 표현 검수
  • 데이터·시스템 담당자: DB 매핑, 식별자, 표준 온톨로지 연결, 버전 관리 검수

검수 우선순위

  1. 1독성, 식용, 약용, 치료 효과, 보호종, 희귀종, 위치 공개 민감 정보
  2. 2학명, 국명, 분류, 서식지, 유사종, 형태 식별 정보
  3. 3전시원, 동선, 관람 포인트, 계절 하이라이트
  4. 4교육 활용, 연령 적합성, 활동지, 퀴즈, 비유 표현
  5. 5홍보 문안, SNS 태그, 감성 표현, 추천 문구

11

주요 산출물

식물 DB 필드 분석 보고서
콘텐츠 생성 사용 사례 정의서
competency question 목록
LLM 후보 추출 프롬프트
온톨로지 후보 데이터셋
후보 병합·정규화 결과표
공개 표준 온톨로지 매핑표
식물 공통 도메인 온톨로지
목적별 응용 온톨로지
SKOS 통제어휘·태그 체계
PROV-O 생성 이력 모델
전문가 검수 워크플로우
콘텐츠 생성 템플릿
출력 JSON 스키마
콘텐츠 검증 규칙서
MVP 시범 콘텐츠 세트

12

단계별 추진 계획

1단계. 기획 및 분석

사업 목표 구체화, 식물 DB 구조 분석, 데이터 품질 진단, 전문가 검수 체계 설계

2단계. 샘플 기반 방법론 검증

대표 샘플 선정, LLM 후보 추출 프롬프트·출력 스키마 설계, 품질 평가

3단계. 전체 DB 후보 추출

전체 식물 DB 후보, 질문 후보, 표준 매핑 후보, 위험 플래그 생성

4단계. 병합·정규화 및 표준 매핑

유사 후보 병합, SKOS 태그 체계, Darwin Core·PO·ENVO·PROV-O 매핑

5단계. 전문가 검수 및 확정

역할별 검수, 고위험 후보 우선 검토, 기관 용어 및 콘텐츠 규칙 확정

6단계. 콘텐츠 생성 플랫폼 연계

RAG 구조, 질의 해석, 프롬프트 템플릿, 검증 규칙, 시범 콘텐츠 생성

13

품질 관리 방안

온톨로지 품질

  • 개념 명확성
  • 상하위 관계 일관성
  • 클래스·속성·태그 구분
  • 표준 매핑 정확성
  • 중복 개념 최소화
  • 콘텐츠 생성 활용성

콘텐츠 품질

  • 식물학적 정확성
  • 기관 DB 근거성
  • 대상 독자 적합성
  • 문체 일관성
  • 안전 정보 반영
  • 출처 추적 가능성

LLM 출력 품질

  • 근거 필드 포함
  • DB 명시 정보와 추론 구분
  • 신뢰도 표시
  • 위험 플래그 표시
  • 표준 매핑 후보 포함
  • 콘텐츠 유형별 후보 분리

14

위험 요소 및 대응 방안

데이터 품질 위험

위험

필드 누락, 중복 레코드, 학명 표기 오류, 전시원명 표기 불일치

대응

데이터 프로파일링, 통제어휘 구축, 정규화 규칙, 전문가 검수 대상 자동 분류

LLM 환각 위험

위험

DB에 없는 약용·식용 정보 생성, 일반 지식의 공식 정보화, 전시 위치 오인

대응

근거 기반 생성, 명시 정보와 추론 구분, 위험 표현 차단, 출처 레코드 필수 포함

온톨로지 과복잡화

위험

모든 후보를 클래스로 만들 경우 구조 비대화, 태그와 정식 개념 혼재

대응

공통 코어와 목적별 모듈 분리, OWL 클래스와 SKOS 태그 구분, MVP 우선 구축

기관 용어 충돌

위험

보유식물, 전시식물, 수집식물, 식재식물의 의미 혼재

대응

기관 용어 사전 구축, 업무 담당자 인터뷰, 용어별 정의와 변경 관리 체계 운영

15

기대 효과

데이터 활용

식물 DB를 콘텐츠 생성 기반 지식 자산으로 확장하고, 생물다양성 표준과 연결합니다.

콘텐츠 생산

도감, 전시 해설, 교육 콘텐츠, 추천 코스 등을 일관된 구조로 자동 생성합니다.

품질·신뢰성

근거 추적, 위험 정보 통제, 전문가 검수 이력 관리로 공식 콘텐츠 신뢰성을 강화합니다.

서비스 확장

맞춤형 추천, 교육 프로그램, 오디오가이드, 챗봇, 키오스크, 모바일 앱으로 확장합니다.

16

결론

본 시스템은 한국수목원정원관리원의 식물 데이터베이스를 생성형 AI 시대에 적합한 지식 기반으로 전환하기 위한 핵심 기반 사업입니다. LLM을 온톨로지 후보 추출 도구로 활용하고, 후보 병합·정규화·표준 매핑·전문가 검수를 거쳐 기관 특화 온톨로지를 구축합니다.

구축된 온톨로지는 식물 공통 도메인 지식과 도감, 전시 해설, 교육 콘텐츠, 추천 코스 등 목적별 응용 지식을 분리 관리합니다. 이를 통해 기관 DB에 근거한 신뢰성 있는 콘텐츠를 다양한 형식으로 생성하고, 생성 결과의 출처와 검수 이력까지 추적할 수 있습니다.