Speech

9월42021

Virtual Influencer Trend

[서비스개발팀 권은지] 인플루언서(Influencer)의 사전적 정의는 타인에게 영향력을 주는 사람입니다. 오늘날 1인 미디어 채널의 발달로 흥미로운 콘텐츠 업로드를 통해 누구나 크리에이터가 될 수 있고 소위 말하는 스타덤에 오를 수 있습니다. 친근함으로…

9월22021

Speech Trend

Translatotron 2

Speech, Trend

[선행연구팀 유희조] 번역은 딥러닝 붐이 일던 초기부터 연구되던 주제입니다. 지금은 어느 분야에서든 사용되는 attention 역시 최초는 Seq2Seq 구조가 갖는 문제를 해결하기 위해 제안된 방법이었습니다. 근 10여년 간 딥러닝 기반 번역기의…

MLP Singer

Speech, Trend

[선행연구팀 유희조] TTS(text-to-speech)는 임의의 텍스트를 넣었을 때 해당 텍스트를 특정한 목소리의 음성으로 변환하여 산출하는 기술입니다. Google이 Tacotron 시리즈를 발표한 이후 HMM(hidden Markov model) 기반에서 딥러닝 기반으로 빠르게 전환되었으며 현재 상용…

5월272021

Speech Trend

Can Machines Think? Emotionally

Speech, Trend

[서비스개발팀 권은지] 어릴 적 상상화를 그림 그리면 우주 공간에 있는 로봇이 단골 소재였습니다. 돌아보면 만화에서(은하철도 999) 기차를 움직이는 인공지능 컴퓨터 기장에서부터 최근 개봉한 휴먼 노이드 영화들까지 미디어에서 인공지능은 하나의 중요한…

5월212021

Speech Trend

LaMDA – 구글의 대화 언어 모델

Speech, Trend

[서비스개발팀 김병인] 최근 진행된 구글의 최신기술을 선보이는 행사인 구글 I/O 2021에서는 안드로이드, 웹, 인공지능, 크롬등 다양한 기술과 서비스, 플랫폼 서비스를 공개했습니다. 많은 기술들중 최고의 화두는 이번에 발표한 LaMDA (구글의 언어…

3월192021

Visual Speech Interaction Code

모바일 기기용 AI 프로젝트 모음 (Awesome Tensorflow Lite)

Visual, Speech, Interaction, Code

Tensorflow Lite는 Tensorflow로 학습된 AI 모델들을 모바일 기기에서 동작시킬 수 있도록 해 주는 도구들을 포함하고 있는 소프트웨어 패키지입니다. 현재 40억개 이상의 기기에서 동작하고 있다고 합니다. 기본적으로 학습된 모델을 Tensorflow Lite…

3월112021

Speech Trend

Google Lyra – 생성 모델 기반 음성 압축

Speech, Trend

Google Lyra는 생성 모델에 기반한 새로운 음성 압축 방식으로서, 기존 음성 압축 방식들이 원본 수준의 음질, 즉 transparent quality를 얻기 위해 약 8-16kbps 정도가 필요한 것을 크게 향상시켜서 3kbps의 낮은…

2월192021

Speech Interaction Code

자연어와 음성 인식 프레임워크의 통합 트렌드

Speech, Interaction, Code

통합 자연어 처리 패키지로 유명한 HuggingFace에 음성 인식 기능이 추가되었습니다. 다음은 관련 링크입니다: 구체적으로 Facebook이 개발한 Wav2Vec 2.0이 추가되었는데, Wav2Vec 2.0은 대량의 라벨링 없는 데이터로 unsupervised learning을 먼저 하고, 매우…

11월182020

Speech Code

Facebook Denoiser: real-time speech enhancement

Speech, Code

Interspeech 2020에 발표되었던 Facebook의 실시간 잡음 제거 기술인 denoiser의 github 링크를 공유합니다. Pytorch로 구현되어 있으며 원 논문 제목은 “Real Time Speech Enhancement in the Waveform Domain”입니다. 제목에서 알 수 있듯이…