KPI뉴스 - 한국인 말·감정 읽는 AI '성큼'…한국형 AI 데이터 250만개 공개

  • 구름많음부산27.9℃
  • 맑음속초28.2℃
  • 맑음동해30.5℃
  • 맑음부여31.7℃
  • 맑음제천30.0℃
  • 맑음충주31.0℃
  • 맑음순천30.1℃
  • 맑음보은31.0℃
  • 맑음수원31.1℃
  • 맑음대구32.1℃
  • 맑음남해29.5℃
  • 구름많음산청30.1℃
  • 맑음강릉32.4℃
  • 맑음진도군30.0℃
  • 맑음진주30.5℃
  • 흐림제주28.8℃
  • 맑음고창군32.0℃
  • 흐림통영28.2℃
  • 맑음홍성31.7℃
  • 맑음장수30.7℃
  • 맑음보성군31.5℃
  • 맑음양평31.1℃
  • 맑음광양시31.2℃
  • 맑음북춘천31.1℃
  • 맑음남원33.8℃
  • 맑음정읍33.1℃
  • 맑음강화28.7℃
  • 맑음대전33.1℃
  • 맑음합천31.6℃
  • 구름많음양산시30.0℃
  • 구름많음서귀포30.2℃
  • 맑음여수29.0℃
  • 구름많음북부산29.0℃
  • 구름많음인제29.4℃
  • 구름많음밀양30.9℃
  • 맑음정선군31.3℃
  • 흐림거제27.1℃
  • 맑음영광군31.0℃
  • 맑음청주31.9℃
  • 맑음파주31.1℃
  • 맑음의령군31.3℃
  • 맑음포항29.4℃
  • 맑음인천30.0℃
  • 맑음영천30.5℃
  • 맑음의성33.5℃
  • 맑음임실31.3℃
  • 맑음천안31.1℃
  • 맑음철원30.2℃
  • 맑음고흥31.9℃
  • 맑음홍천30.0℃
  • 맑음경주시30.0℃
  • 맑음창원29.7℃
  • 맑음목포30.9℃
  • 맑음백령도26.4℃
  • 맑음해남31.3℃
  • 맑음광주33.8℃
  • 맑음서울31.4℃
  • 맑음순창군32.9℃
  • 맑음영월31.8℃
  • 구름많음울산28.0℃
  • 맑음세종32.2℃
  • 맑음금산32.0℃
  • 구름많음김해시
  • 맑음봉화29.0℃
  • 맑음강진군32.1℃
  • 맑음군산30.8℃
  • 맑음서청주30.3℃
  • 구름많음북창원31.2℃
  • 맑음울릉도27.5℃
  • 맑음부안30.9℃
  • 맑음춘천31.4℃
  • 맑음함양군34.2℃
  • 맑음원주31.4℃
  • 맑음서산31.1℃
  • 맑음추풍령31.7℃
  • 맑음청송군32.4℃
  • 맑음보령31.3℃
  • 맑음전주33.5℃
  • 맑음고창31.8℃
  • 구름많음고산28.2℃
  • 맑음이천30.6℃
  • 맑음북강릉31.1℃
  • 맑음상주33.0℃
  • 맑음영주30.7℃
  • 맑음거창33.4℃
  • 맑음흑산도31.4℃
  • 맑음동두천31.3℃
  • 맑음태백28.9℃
  • 맑음대관령27.0℃
  • 맑음완도30.9℃
  • 맑음안동33.2℃
  • 맑음울진27.9℃
  • 구름많음영덕28.4℃
  • 맑음장흥29.9℃
  • 맑음구미31.9℃
  • 구름많음성산29.2℃
  • 맑음문경31.7℃

한국인 말·감정 읽는 AI '성큼'…한국형 AI 데이터 250만개 공개

이제은 Google구글에서 선호하는 출처로 추가
기사승인 : 2019-06-15 14:28:33
한국정보화진흥원, 한국어 음성·대화·복합영상 데이터 250만개 개방
감정·상황·대화내용 복합영상 데이터, 한국어 기계독해 데이터 등 4종

한국 사람의 감정에 대한 영상 정보, 한국어의 자연스러운 발성정보를 담고 있는 인공지능(AI)용 데이터가 개방된다.

한국정보화진흥원(원장 문용식, 이하 NIA)은 14일, 250만개의 인공지능 학습용 데이터를 공개했다고 밝혔다. 공개된 데이터는 △ 감정, 상황, 대화내용을 담고 있는 복합 영상 데이터 △ 자연스러운 한국어 대화 음성 데이터 △ 한국어 챗봇용 대화 및 시나리오 데이터 △ 한국어 기계독해 데이터 4종이다.

이번 데이터 개방이 인공지능기술의 활용 스펙트럼을 넓히고, 관련 AI 서비스의 상용화를 촉진하는 계기가 될 것으로 전망된다.

데이터는 NIA가 운영하는 AI허브 홈페이지에서 간단한 회원가입을 통해 누구나 내려받아 사용할 수 있다.



▲ 인공지능 학습용 데이터 구축‧현황 및 계획 [한국정보화진흥원 제공]


공개된 AI 데이터별 활용 가능 서비스로는 △ 복합영상(멀티모달) 데이터: 사람의 표정과 대화 속에 내포된 감정을 읽고 사람과 공감하면서 대화하는 AI로봇의 개발 △ 한국어 음성 데이터: 2∼3명이 서로 자연스럽게 연속하여 발화하는 음성데이터로 기존 한국어 AI음성 인식기술 성능 향상  △한국어 대화 데이터: 음식점, 소매점, 학원 등 소상공인 업종에서 자주 발생하는 상황과 질문‧답변을 데이터로 제공하여 AI 챗봇 개발에 활용 △ 한국어 기계독해 데이터: 다양한 질문과 정답의 쌍을 AI에 딥러닝시켜 전후 맥락을 짚어 정확한 답변을 찾아 제공하는 AI로봇 개발 등이다.

현재 데이터의 확보가 AI 경쟁력이지만 대다수의 중소.벤처.스타트업은 많은 비용과 시간이 소요되는 데이터 구축에 어려움을 겪고 있다. 따라서 '인공지능 데이터 구축‧공개 사업'은 AI 시장에 막 진입하고자 하는 신생기업들에 매력도가 높은 사업이다.

그간 정부는 2017년부터 법률, 특허, 일반상식, 한국형 이미지 4종의 데이터셋 구축을 시작해 2019년 1월에는 관광, 농업, 헬스케어 등 7종을 개방했고, 6월에 한국어 음성 등 4종을 추가 개방했다.
올해 말에는 한-영 번역말뭉치, 한국형 사물이미지, 한글 글자체 이미지, 이상행동 영상 등 10종 2,500여만건의 데이터셋을 대량 공개할 예정이다.

또한 국가 연구개발(R&D) 과제인 지능정보 플래그십 사업 등을 통해 만들어진 인공지능 학습용 데이터 다수를 올해 7월 AI허브에 공개할 예정이다. 지능정보 플래그십 사업은 음성‧언어‧영상 등 다양한 정보를 복합적으로 학습해 사람과 상호작용하는 대화형 에이전트 기술 및 서비스를 개발하는 AI분야 연구개발(R&D) 사업이다.

NIA 문용식 원장은 "인공지능 제품과 서비스가 활발히 개발되고 출시될 수 있도록 수요에 꼭 맞는 데이터셋을 대량 구축‧공개해 국내 인공지능 산업과 시장의 경쟁력을 강화하는데, 역량을 집중하겠다"고 밝혔다.

KPI뉴스 / 이제은 기자 lsy@kpinews.kr 

[저작권자ⓒ KPI뉴스. 무단전재-재배포 금지]