1. 개요
VocaTone는 2011년에 설립된 미국의 소규모 VOCALOID 기업이다. PowerFX의 지원을 받아 2012년에는 VOCALOID3 OLIVER를 제작하였고 2013년에는 YOHIOloid를 제작해 발매했다.2. 상세
사실상 그 의의는 '영미권의 보컬로이드 덕후들이 설립한 회사'라고 봐야 할 것이다. VOCALOID에 관련해서 직접적으로 개입하고 싶어하는 양덕후들이 하나 둘 모여 세우게 되었다. 아무래도 소규모라 영향력이 크게 없는 만큼 팬층의 지지 확보가 중요할 듯. (참고)2016년 새로운 보컬로이드를 제작하고 있다고 했으나 그 이후로 오랫동안 소식이 없었다. 그러다가 2020년 12월 10일 오랜 공백을 깨고 "Big news comming soon"이라는 공지를 올렸다! 그리고 12월 23일 OLIVER의 생일날, 새로운 캐릭터의 실루엣을 공개했다. (참고) 12월 25일 Maghni AI라는 새로운 음성 합성 엔진을 발표했다. MISBAH STUDIOS라는 기업과 공동으로 개발하며 신규 캐릭터인 AURUM, AUDINE도 공개되었다. 대응 언어는 영어, 일본어, 스페인어, 한국어를 포함한 총 40가지 언어를 지원할 예정.
2023년 12월 28일 인디고고에서 크라우드 펀딩이 시작되었다. 12월 30일 목표 금액에 달성했다. 2024년 9월 28일부터 Maghni AI는 Misbah Studios가 설립한 회사 Crescendia가 개발하고 있고 VocaTone은 Maghni AI 개발에서 손을 뗀 상태다.
2016년 이후 새로운 캐릭터의 엔진을 교체하거나 OLIVER의 신규 라이브러리를 MAGHNI AI로 개발한 것으로 보아 이 기업도 VOCALOID 진영을 완전히 벗어난 것으로 보인다. 그러나 크라우드펀딩 이후 2026년이 되어서도 Maghni AI 개발에 진전이 보이지 않는 데다 후원자들에게 펀딩 굿즈 배송까지 지연되고, 아래의 사건으로 VocaTone에 대한 여론이 최악이다.
3. 논란 및 사건사고
3.1. Maghni AI 크라우드펀딩 사기 사건
Maghni AI는 펀딩 당시 2024년 12월에 출시 예정이라고 되어 있었으나, 2026년 기준 여전히 개발 중이다. 첫 발표가 2020년이었으니 실제 개발 기간은 5년 이상이다.[1] 펀딩 이후 VocaTone이나, 개발을 이어받은 Crescendia나 소식을 전하지 않았고, 리워드 배송도 질질 끌고 있어 이에 불만을 표하거나 사기 아니냐고 의심하는 유저도 있었다.2025년 8월 10일 Maghni AI 블로그에 게시된 글에 따르면, 경영진이 교체되면서 개발 팀을 새로 구성했으나 엔진의 원본 소스 코드와 인프라 접근 권한이 제한되어 있어서 개발에 난항을 겪고 있으며, 거기에 펀딩 리워드 굿즈를 현 개발진이 사비를 털어서 제작했다고 한다.
10월 14일 개발팀 멤버 중 한명이 Maghni AI 개발 현황을 설명했는데 해당 글에 따르면 현 개발팀 인원이 고작 5명뿐인데다 개발비를 펀딩 자금이 아닌 개발팀의 사비로 충당하고 있다고 한다. 또한, 굿즈는 배송 권한을 갖고 있는 VocaTone에게 전달했다고 밝혔다. 이후 다음 날 15일, VocaTone에서 Maghni AI에 대해 입장을 밝혔다.링크 VocaTone은 자신들은 현재는 서드파티일 뿐, 이미 Maghni AI 개발에서 물러났으며 펀딩 자금은 Misbah Studios가 관리했었기 때문에 자금에 대해서는 무관하다고 해명했다. 그러나 Maghni AI를 처음 발표한 것과 크라우드펀딩을 실시한 주체는 VocaTone이었고, 리워드 배송 권한도 VocaTone에게 있기에 이는 책임 회피에 불과하다.
VocaTone 측에서는 2025년 말부터 굿즈를 배송 중이며 후원자 중 무사히 굿즈를 받은 사람도 있긴 하지만 여전히 지지부진한 상태다. Maghni AI도 개발이 더딘 판에 굿즈 배송마저 질질 끌고 있어 팬덤 내에서는 VocaTone에게 실망감을 드러내고 있다. 현 개발팀도 블로그 글 이후로 1년이 지났음에도 아무런 소통도 하지 않아 개발팀에 대한 여론도 좋지 않았지만 후술할 폭로글이 나온 이후로 현 개발팀을 비난하는 의견은 줄어들었다.
결국 2026년 7월 13일 펀딩에서 320 달러를 후원했던 한 팬이 관계자들을 규탄하는 공개 서한을 올렸다. 내용은 전액 환불 요구, 오랜 소통 부재, AURUM의 음성 제공자 관련 논란[2], 리워드 배송 지연, PowerFX 캐릭터의 권리 여부[3], 인디고고 약관 위반 등 여러 문제에 대한 해명을 요구하며 2026년 12월까지 어떠한 해명도 없다면 법적 대응을 하겠다고 쓰여있다. 이 서한이 공개된 후 VocaTone을 비판하는 의견이 속출하였다.
3.1.1. 전 MISBAH STUDIOS 대표의 폭로
7월 14일 전 MISBAH STUDIOS의 CEO이자 Maghni AI의 개발 디렉터였던 나탈리아 쉬무엘리(Natalia Shmueli)가 VocaTone의 만행에 대한 폭로글을 올렸다.당초 나탈리아가 맡은 역할은 언어 개발이었지만 라이브러리 개발, 음성 제공자 고용, 굿즈 제작, 사이트 개발과 수수료, 브랜딩, 로고 디자인 등 본래 VocaTone이 맡았어야 할 작업들을 나탈리아 개인이 모조리 떠맡게 되었고, 그 비용도 전부 나탈리아가 내야 했다. 심지어 개발자들의 급여까지 나탈리아가 사비로 지급했으며 이 과정에서 나탈리아가 쓴 비용만 20만 달러(약 2억 7천만 원)였고 이는 나탈리아가 평생 저축해서 모은 돈이었다. 게다가 전임 소프트웨어 개발자(Barham Karim)가 이민법 문제로 추방당할 위기에 처하자, 돈을 요구해서 나탈리아는 그에게 10,000 달러를 주었다.[4] 그러나 그는 펀딩 끝난 직후 밀린 급여 18,000 달러를 요구했고, 급여를 주지 않으면 작업을 중단하고, 소스 코드 제어권을 넘기지 않겠다고 협박해서 나탈리아는 어쩔 수 없이 18,000 달러를 송금해줬다. 하지만 그 후 개발자는 연락을 끊고 잠적해버렸다.
또한 VocaTone에게서 모델 학습용 컴퓨터 장비를 구매하는 데 비용을 보태라고 압박하자, 나탈리아와 라이브러리 개발자가 사비로 약 14,500달러(약 2000만 원)를 부담했으나, 그 컴퓨터는 전임 개발자의 집으로 배송되었고 전임 개발자가 잠적하면서 나탈리아는 컴퓨터 구경도 못했다.
이뿐만 아니라 나탈리아는 VocaTone 대표에게 지속적으로 괴롭힘과 가스라이팅을 당했다. 2024년 5월, VocaTone 대표는 나탈리아를 자신의 집에 무상으로 얹혀 살게 해주었지만, 사전 논의도 없이 자기 친구들의 보이스뱅크 프로젝트를 추가하여 무급 노동과 비용 부담을 강요했고, 나탈리아의 개인 프로젝트를 VocaTone의 이미지에 해가 된다며 비하하고, 타 음성 합성 엔진 회사와 협업을 하려고 시도하면 경쟁사라는 이유로 방해했다. 또 VocaTone이 자사 라이브러리 라벨링을 제대로 못해서 외주를 줘야 했을 때, 라이브러리 개발자들에게 약 20,000 달러를 지불해야 하지만 대표는 이를 나탈리아에게 떠넘겼고, 나탈리아가 이를 거부하자, Maghni AI 개발에서 강제로 물러나게 했다.
결국 일련의 사태들로 인해 나탈리아는 정신 건강이 악화되어 2025년 3월에 자살 시도를 했으며, 현 Maghni AI 개발팀이 그녀를 걱정해서 퇴사를 권유했고 이후 나탈리아는 맡고 있던 작업을 끝내고 4월에 퇴사했다.
나탈리아는 현 Maghni AI 개발팀(Crescendia)도 피해자라며 VocaTone과 전임 개발자가 소스 코드와 자금을 독점하고 잠적해버려 몇안되는 코드로 개발을 이어가고 있다고 밝혔다. 게다가 그 코드마저도 하나는 추론 엔진의 일부고[5], 다른 하나는 질 낮은 연결형 음성 합성(concatenative synthesis)코드였다. 이 연결형 음성 합성은 음성을 자르고 이어 붙여서 만드는 기술로 VOCALOID 1 ~ 5세대, UTAU에서 쓰인 오래된 기술이다. 즉 AI가 아니다.
이후 Maghni AI판 OLIVER의 데모곡을 만든 SUZIE-P도 폭로를 했는데 크라우드펀딩을 한 이유가 Maghni AI의 개발비를 벌기 위해서가 아니라 개발자의 이민법 문제를 해결하기 위해 돈을 모으기 위해서였으며, Maghni AI판 OLIVER의 데모는 사실 AI가 아니라 RVC로 짜집기해서 만든 음성이라고 고백했다.#
종합해보면 VocaTone은 애초부터 AI 음성 합성 엔진을 만들고 있지 않았으며, Crescendia가 엔진을 처음부터 만들고 있는 상황이다. 사실상 사기라고 해도 무방하다.
3.1.2. VocaTone 전 대표의 입장문과 나탈리아의 반박
7월 15일 VocaTone 대표 오스틴 그리섬(Austin Grissom)이 입장문을 올렸다. 내용은 다음과 같다- 크라우드펀딩의 목적이 개발자의 추방을 막기 위해 돈을 모은 것이 맞다.
- OLIVER의 데모는 Synthesizer V의 SVP 파일에서 추출한 타이밍 데이터를 이용했다.
- 펀딩 자금은 나탈리아의 계좌로 받아서 자신도 자금의 행방을 모른다. 펀딩 금액 4만 달러는 나탈리아의 통장으로 입급되어 있다. 그리고 나탈리아가 폭로글을 올리기 직전 자신과 나눈 디스코드 메시지가 삭제되었다.
- 문제의 전임 개발자는 나탈리아의 친구의 추천으로 데려온 인물로 전문가인줄 알았지만 엔진을 코딩하면서 그제야 코딩 방법을 실시간으로 배워가며 개발하고 있다는 게 눈에 보일 정도로 초짜였던 일반인이었다.
- 돈이 없어서 개발 팀원이 사비를 털어서 리워드 제작 비용을 지불하였다.
- 라이브러리 개발자들에게 지불해야 할 돈이 없어 제품 발매 후 잔여 수익금과 일시불로 지급하는 계약을 하였다. 당시엔 문제없었지만 Maghni AI의 개발이 늦어지자 개발자들이 항의를 하였고 OLIVER의 라이브러리 개발만을 계속하는 조건으로 4,500달러(약 600만 원)의 일시금을 지급하기로 합의를 했다. 이 돈은 오스틴의 아버지의 사망보험금이었다.
- OLIVER의 음성 제공자는 돈을 받지 못했다. Audine의 음성 제공자의 경우, 나탈리아가 지불해 줬다고 한다.
- VocaTone 캐릭터(OLIVER, Audine, Aurum)의 저작권을 Crescendia에게 양도하였다.[6]
- 배송이 늦어지는 이유는 비용이 없어서이고, 12월까지 리워드 배송을 마무리할 것이다.
- 자금을 조달하기 위해 벤처 캐피탈을 찾아가서 십만 달러 수준의 투자 제안 두건을 받았지만 이미 개발 환경이 파탄난 상황이라 거절했다.
- 마지막으로 VocaTone 대표 자리를 소속 일러스트레이터인 Crossy에게 넘기고 사임하겠다고 밝혔다.
입장문이 올라온 후 나탈리아가 오스틴의 일부 주장을 반박하는 추가 폭로글를 올렸다.
- 오스틴이 나탈리아가 디스코드 메시지를 먼저 삭제했다고 주장했으나 오스틴이 먼저 메시지를 지운걸 보고 나탈리아가 디스코드 방을 폭파시킨거다.
- 나탈리아가 펀딩 자금을 관리하고 있는 것은 사실이다. 이는 팀원들과 오스틴 모두가 동의 하에 결정한 일이라며 장부를 공개했다. 은행 명세서 등 자금 이용 기록이 남아있으며, 나탈리아가 이를 전부 보유하고 있다. 공개된 장부를 보면 총 모금액은 39,387.72 달러(약 5,300만 원)이며, 자금은 펀딩 후 전임 개발자에게 준 18,000 달러와 개발비, 굿즈 제작비, 포장비, 성우 비용 등으로 쓰였다. 비록 전임 개발자에게 일부 떼먹히긴 했지만 대부분 개발비와 리워드 제작비로 제대로 쓰였다.
- 전임 개발자에게 준 10,000 달러는 펀딩을 시작하기 전에 나탈리아가 이미 지불했다. 여기서 펀딩 자금은 하나도 쓰이지 않고 전부 나탈리아의 사비였다.
- 오스틴의 입장문에는 라이브러리 개발자에게 지급할 돈이 본래 나탈리아가 냈어야 할 돈이라는 식으로 서술했지만 계약의 주체는 VocaTone이므로 오스틴이 내는게 맞다.
- 개발자가 소스 코드를 인질로 삼아서 돈을 요구할 당시, 오스틴은 "뭐, 어쩌겠냐"면서 수수방관하였다.
- 음성 제공자에게 돈을 줘야 하는 건 오스틴이 해야 할 일인데 나탈리아가 Audine의 음성 제공자에게 돈을 지급했을 때, 정작 오스틴은 나탈리아를 "참 착하다"며 비꼬았고, 나중에 그 돈을 갚겠다고 말해놓고, 나탈리아를 차단하고 잠적했다.
- 비용이 없어서 배송이 늦어진다고 주장했으나 굿즈비와 배송비는 이미 나탈리아가 결제해서 VocaTone에게 보낸 상황이다. 진짜로 늦어지는 이유는 오스틴이 일을 안해서다.
- 소스 코드 인수인계 당시 개발팀은 개발자에게 "나머지는 우리가 알아서 고칠테니까 형편없는 상태여도 좋으니 코드를 달라"며 메시지를 보냈다. 그렇게 코드를 받아냈음에도 학습 파이프라인 코드를 따로 받아내야 했다.
- 데모 음성 자체는 Maghni 엔진에서 자체적으로 출력된 것이 맞다. 다만 엔진 성능이 좋지 않아 비는 사운드와 자음을 메꾸기 위해 RVC로 보정한 것이다. 나탈리아는 처음에 이를 반대했지만 오스틴을 비롯한 주변 인물들이 이대로 공개하자고 찬성했다.
- 오스틴은 투자 제안을 받았다고 주장했으나 입장문에 첨부된 사진은 1차 비대면 면접 초대장과 단순한 펀딩 소개서일뿐, 투자 승인서가 아니다. 즉 투자 제안을 받았다는 말은 거짓말이다.
- 오스틴은 Maghni AI를 방치해놓고 또 다른 음성 합성 엔진 프로젝트를 시작했다며 떠들고 다녔으며, 아무것도 모르는 음성 합성 엔진 개발팀과 협업을 진행하고 있었다.[7]
3.1.3. Maghni AI 개발팀의 입장문
오스틴의 입장문과 나탈리아의 반박문이 공개된 이후 Maghni AI 개발팀의 입장문이 올라왔다.- 이전 경영진(VocaTone)과의 갈등으로 인해 디렉터는 팀원들이 반대에도 불구하고 제대로된 결과물이 나올 때까지 침묵하는 것을 택했다. 물론 이는 소통 부재로 이어져 후원자들의 비난을 받았다.
- 작년부터 개발팀을 재편한 이후 개발비를 팀원들의 사비로 부담하고 있다. 팀원 중에는 개발비를 충당하려고 직장일과 개발을 병행하는 인물도 있다.
- 리워드 굿즈는 제작을 다 끝내고 VocaTone에게 보냈으나 정작 VocaTone 측에서 배송을 하지 않아 무용지물인 상황이다.
- 환불은 펀딩 주체인 VocaTone이 처리해야 하지만 개발팀이 VocaTone에게 연락을 시도해봤지만 소통을 차단한 탓에 VocaTone에게 직접 메일을 보내라고 한다.
- 아직까지 출시일은 미정, 대신 일부 핵심 툴을 오픈 소스로 공개했다.
- 엔진 이름을 AI를 뺀 'Maghni'로 변경하여 계속 개발할 것이라고 밝혔다. 그 후 아예 엔진 이름 자체를 교체하기로 하였다.
임장문이 발표된 후 개발 팀원 중 한 명인 Cocoa가 'Maghni AI OLIVER의 데모는 Synth V로 만든거다'라는 루머를 해명하기 위해 실제 Maghni 엔진의 음성을 공개했다.음성 중 일부 SynthV의 음성을 쓴게 아니라 신스V 프로그램 안에서 사람이 직접 마우스로 음정 곡선(Pitch curve)을 그린 뒤, 그 데이터만 추출해 마그니 엔진에 강제로 주입시키고, 발음이 비는 부분을 RVC로 짜집기 한 것이다. 물론 이는 엄연히 불법이고, 사기다.
3.1.4. VocaTone의 환불 공지
7월 17일 VocaTone에서 환불 공지를 올렸다. 허나 그와중에도 "저희는 인디고고 캠페인의 제작자가 아니며 캠페인 자금은 받지 않았습니다."라며 책임 회피를 하고 있고, 환불을 요청하려면 캠페인 제작자인 나탈리아 쉬무엘리에게 문의하라며 환불 대응을 나탈리아에게 떠넘기고 있다. 인디고고 크라우드펀딩은 엄연히 VocaTone의 이름을 걸고 시작했으니 펀딩의 책임은 당연히 VocaTone이 져야 한다.인디고고 펀딩 페이지이를 본 나탈리아가 또 반박글을 올렸다.문서 나탈리아는 VocaTone이 올린 환불 신청 구글 폼에 "실제로 환불을 처리해 주겠다"라는 문구가 없어 실제로는 환불 신청 의사를 기록만 해놓고 "신청하면 해당 패키지(굿즈)는 별도로 보관된다"라고 써있어 신청하면 실제로는 환불은 안되고 굿즈도 넘기지 않을 속셈이라고 비판했다. 그리고 VocaTone의 만행은 미국 연방법, 위스콘신 주법 위반이므로 VocaTone을 고발하라며 고발처 링크도 남겼다.
3.1.5. 개발팀이 밝힌 전말과 Q & A
7월 21일 개발팀으로부터 사건의 전말을 밝히는 글과 Q & A를 올렸다.링크2020년 12월까지 나탈리아 쉬무엘리(MISBAH STUDIOS)와 오스틴 그리섬(VocaTone)이 공동으로 Maghni AI 개발을 시작했고, 초기 자금은 나탈리아가 지원해줬다. 2019년 12월에 프로그래머를 구하기 위해 온라인 공고를 냈고, 그 결과, 문제의 개발자인 Barham Karim이 채용되었다.
초기엔 연결형 음성 합성으로 개발하다가 2020년 12월 발표 직후, AI 음성 합성으로 변경했다.[8] 이후 어느 정도 역량있는 개발자들이 합류하고, Barham에게 소스 버전 관리에 코드를 올리라고 지속적으로 요청했지만, 끝내 그가 올린 건 더 이상 사용할 수 없는 연결형 음성 합성 코드였다.
2023년 12월까지 개발이 늘어지자, 나탈리아는 더 이상 자금 지원을 할 수 없게 되었고, 여기에 Barham의 독일 비자 문제와 더불어 재정 지원 증빙 서류가 필요해지자, VocaTone의 협력으로 크라우드펀딩을 열었다. 펀딩 수익금 대부분은 Barham의 인건비로 주었고, 나머지는 굿즈 제작비로 쓰였다.[9] 이후 개발은 꾸준히 진행되었지만 Barham은 업데이트가 몇 달식 지연되기 일수였고, 그를 지원하기 위해, 나탈리아와 라이브러리 개발자가 사비를 털어서 AI 학습용 장비를 구매해서 Barham에게 보내주었다. 이후 나탈리아는 개인 사정으로 프로젝트를 떠났지만 Barham과의 소통을 위해 개발팀과의 관계를 유지했다.
허나 그런 노력에도 불구하고, Barham과의 소통은 점점 뜸해졌고, 2025년 7월 9일 Barham에게서 마지막 코드를 받은 이후, 모든 작업을 중단하고 잠적했다. 연결형 코드 이후 추가로 받은 코드가 하나뿐이었는데 이미 학습된 모델을 돌려 소리를 출력하는 '추론 스크립트'였고, 정작 중요한 학습, 엔진 코드가 없었고, 엔진도 최적화가 안되서 불완전한 상태라 개발이 불가능한 상황이었다.
결국 4년의 개발 기간과 개발비를 모두 날린 꼴이 되었고, 개발팀은 Barham이 만든 코드를 폐기하고, AI 엔진을 처음부터 다시 개발하고 있다. 그리고 현 개발팀은 과거 개발을 이끌던 나탈리아와 오스틴과는 더 이상 관련이 없다고 밝혔다.
개발팀이 밝힌 전말을 보고 나서, Maghni AI 발표 당시 VocaTone의 페이스북 글을 보면 이 글의 내용이 거짓말이었다는 걸 알 수 있다. 글에는 "지난 3년간 Maghni AI는 눈부신 발전을 이루었습니다."라고 써있는데 그 말인즉 2017년부터 개발 중이었다는 얘기다. 그러나 2019년 12월에 프로그래머를 구하려고 공고를 냈다는 건 그 전까지 프로그래머가 없었다는 말이 된다. 일반적이라면 그 3년은 엔진 기초 설계를 하고 있을 시간인데, 프로그래머 없이 개발했을 리 만무하니, 처음부터 거짓말이었을 가능성이 높다. 거기에 "Maghni AI는 실제 가수들의 발성 변화를 분석하여 훨씬 더 자연스럽고 감성적이며 인간적인 사운드를 구현하는 다재다능한 머신러닝 알고리즘을 기반으로 합니다."라고 써있지만 실상은 발표 직전까지 연결형 음성 합성으로 만들다가 발표 후에 부랴부랴 AI 엔진으로 바꾼 거라는게 밝혀져 이제와서 보면 애초부터 사기치려고 밑밥 깐걸로 밖에 안 보인다.
- [이하 Q & A]
- >Maghni AI는 Synthesizer V Studio 엔진의 출력물을 사용하여 렌더링을 생성한건가요?크라우드펀딩 과정에서 생성된 렌더링 이미지가 다른 제품의 엔진 출력물을 그대로 사용했다는 주장이 제기되었습니다. 저희는 이러한 주장이 엔진 초기 버전의 추론 방식에 대한 오해에서 비롯된 것이라고 생각합니다. 크라우드펀딩 캠페인 기간 동안 프로듀서나 조교자에게 데모 제작을 위한 에디터 프런트엔드를 제공할 수 없었습니다. 추론 코드는 Barham의 컴퓨터에 남아 있었기 때문에 에디터와의 통합이 불가능했습니다. 대신, 저희는 아티스트들에게 MIDI 노트와 해당 단어가 포함된 프로젝트 파일을 먼저 요청했습니다. 어떤 MIDI 에디터든 상관없었지만, 대부분은 사용 편의성 때문에 Synthesizer V를 선택했습니다. 그 후, 저희는 각 단어의 길이를 계산하고 자체 타이밍 시스템을 사용하여 타이밍을 생성했습니다. 출력물은 각 MIDI 노트가 렌더링될 음소를 나타내는 MIDI 파일이었습니다. Maghni의 시스템을 사용한 개별 노트 길이와 음소 필드도 추론 파이프라인으로 전달하기 위해 MIDI 정보에 포함되었습니다. 또한 개발자가 엔진에 직접 복사할 수 있도록 1차 피치 커브도 제공되었습니다. 이러한 방식의 엔드투엔드 합성 파이프라인은 오디오를 입력으로 받을 수 없고, 음소 토큰, 음절 길이, 프레임별 음높이만 입력으로 받습니다. 아티스트와 데모 제작자들은 초기 MIDI 생성 과정과 음소 길이 편집을 위한 솔루션만 필요했습니다. 크라우드펀딩 기간 동안 공유된 이미지는 실제 정보를 수집한 파일과 정확히 일치하지 않았습니다. 이 파이프라인은 각 음표가 음소이고, MIDI 음표의 가사 데이터가 렌더링될 음소인 MIDI 파일로 생각하면 이해하기 쉽습니다. 또한, 모든 정보를 수동으로 생성하여 엔진에 입력하는 작업이 완전하게 연결된 에디터 없이는 어려웠기 때문에 데모 제작에 많은 시간이 소요된 이유도 바로 이 때문입니다.
올리버의 데모에서 RVC를 사용했나요, 아니면 자음을 붙여서 사용했나요?
올리버의 "Right Where You Are" 데모 제작을 위해 RVC는 먼저 짧은 음성 파트를 만드는 데 사용되었습니다. 당시 엔진 출력이 불안정했지만, 경영진의 감독 하에 이 작업이 승인되었습니다. 렌더링된 음원은 두 가지 버전으로 추가 제작되었습니다. 하나는 RVC로 생성된 자음과 고음을 사용한 버전이고, 다른 하나는 올리버의 음성 제공자가 제공한 소스 파일의 자음을 사용한 버전입니다. 최종 결과물에는 RVC로 편집된 렌더링 음원이 사용되었으며, 나머지 60~80%는 원본 Maghni 출력으로 남겨졌습니다.
참고로, 마그니의 다른 시연 영상은 이와 같이 편집되지 않았습니다.
Audine의 샘플은 도용한 건가요?
Audine의 음성은 나탈리아가 전액을 지불하여 개인 가수가 제공했습니다. 데모를 만들 때, 작곡가가 '무료 비트(Free Beats)'를 제공하는 유튜브 채널에서 반주를 가져온 것이 였습니다. 저희는 이 사실을 알지 못했고 고지받지도 못했습니다. 이 사실을 알게 된 후, 영상에 주의사항을 추가했습니다.
코드는 어떻게 됐나요?
저희는 저장소 접근 및 소스 코드 제공을 수차례 요청했지만, 모델에서 오디오를 생성하는 추론 코드와 매우 오래된 연결 코드, 이렇게 두 부분만 받았습니다. 현재 저희는 기존 구현 방식을 기반으로 새로운 엔진을 재구축하는 작업을 진행 중이지만, 오래된 연결 코드는 프로젝트에 도움이 되지 않았습니다.
그 장비(AI 학습용 컴퓨터)는 어떻게 됐나요?
훈련에 편리하게 사용할 수 있도록 해당 장비는 Barham에게 직접 배송되었습니다. 저희가 알기로는 현재 그 장비는 독일에 있습니다. 훈련용 장비를 구매한 이후 개발 과정 중 어느 시점에서도 다른 팀원들에게는 제공되지 않았습니다.
왜 이렇게 오래 걸리나요?
저희 엔진의 핵심 소프트웨어와 하드웨어는 여러 차례 재개발되었습니다. 최선을 다했음에도 불구하고, 코드를 거의 처음부터 세 번이나 다시 작성해야 했습니다. 현재 엔진 버전은 1년도 채 되지 않았습니다. 이렇게 많은 차질이 없었으면 좋았겠지만, 저희는 이 프로젝트를 끝까지 완수하기 위해 최선을 다할 것입니다.
Maghni의 VocaTone 라이브러리(Audine, Aurum, Oliver)의 미래는 어떻게 되나요?
Crescendia는 자사의 보컬 라이브러리 및 엔진 제품 녹음에 대한 모든 권리를 보유하고 있습니다. 라이브러리 개발은 추후 공지가 있을 때까지 모두 중단됩니다.
현 개발팀이 후원자들의 환불 요청을 처리할 수 있나요?
Crescendia는 크라우드펀딩으로 모금된 자금을 수령하거나 관리하지 않으며, 보카톤의 재고, 배송 과정, 회계 또는 환불 시스템도 관리하지 않습니다. 따라서 저희가 받지 못한 금액에 대해서는 환불해 드릴 수 없습니다.
구조 조정을 한 이유가 뭔가요?
VocaTone과 Misbah는 Maghni AI 엔진을 '공동 프로젝트'로서 대외적으로 홍보하고 내부적으로 운영해 왔습니다. VocaTone이 개발 참여를 중단한 이후, 저희의 개발 작업은 Misbah와 Crescendia의 주도 하에 계속해서 이어졌습니다. 나탈리아는 결국 적극적인 개발 참여에서 물러났지만, 주요 정보가 필요하거나 Barham과의 연락을 중개해야 할 때 팀과의 소통 창구 역할을 유지했습니다. 참고로, 본 질의응답은 이전 당사자들 간의 법적 소유권 분쟁을 해결하려는 목적으로 작성된 것이 아닙니다.
현재 저희 개발팀은 두 회사로부터 업무를 분리하기 위해 필요한 법적 절차를 밟고 있습니다. 이 과정이 마무리될 때까지 양해 부탁드립니다.
리브랜딩을 할 예정인가요?
현재 저희 팀은 기존 프로젝트 책임자들과 더 이상 아무런 관계가 없습니다. 소유권 변경을 명확히 보여주기 위해 회사명을 Maghni에서 완전히 변경하는 것이 최선의 방법이라고 판단했습니다. 현재 새로운 브랜딩을 구축하는 데 시간을 투자하고 있습니다.
향후 변경 사항에 대해서는 계속해서 알려드리겠습니다. 투명성을 위해 말씀드리자면, 엔진 제품은 초기 투자 당시와는 완전히 다르며, 라이브러리는 이름만 유지되었을 뿐입니다.
공개 디스코드 서버가 개설될 예정인가요?
저희는 앞으로 몇 달 이내에 공개 디스코드 서버를 개설할 계획입니다. 이 서버를 통해 소식과 업데이트 사항을 누구나 무료로 확인하실 수 있게 됩니다. 현 개발팀과 더 직접적으로 소통하고 싶다는 요청이 많았던 만큼, 저희는 소통의 장을 마련하여 주기적인 업데이트와 소식을 제공하는 것을 목표로 하고 있습니다. 서버 운영진 구성 및 관리 체계 마련 작업을 진행 중이며, 자세한 사항은 추후 공지하겠습니다.
왜 아직도 이 일을 하고 있나요?
저희 팀은 그 동안 해온 작업에 대해 여전히 열정을 가지고 있으며 유용한 제품을 출시할 수 있다고 확신합니다.
엔진 개발 관련 질문
현재 엔진 개발을 하고 있는 사람들은 누구이며, 그들의 역할은 무엇인가요?
* 닉네임 ccodaze 혹은 Cocoa로 알려져 있는 Caleb은 디렉터, 백엔드 개발자이자 만능 재주꾼입니다.
* 'Tart'라는 닉네임으로 알려져 있는 vocatart는 라이브러리, 스크립팅, 언어학 개발자입니다.
* Miguel은 'Aku'라는 닉네임으로 활동하며 디자인, 브랜딩, 프론트엔드 개발자입니다.
그 외 익명을 요구한 다른 팀원들도 함께 합니다.
현재 엔진을 완성하는 데 얼마나 걸릴까요?
저희가 현재 버전의 엔진을 개발하기 시작한 지 1년의 3분의 2(약 8개월) 정도밖에 되지 않았습니다. 저희는 또다시 약속을 어기는 일이 없도록 하기 위해 대략적인 예상 일정조차 말씀드리지 않고자 합니다. 대신, 준비가 되는 대로 최대한 빠르게 샘플 음성을 공개해 선보이도록 하겠습니다.
예전에 들었던 엔진과 비교 했을 때, 현재 엔진은 무엇이 달라졌나요?
저희가 전달받은 코드는 조음 네트워크(acoustic articulation network)의 극히 일부분(단순 추론만 겨우 가능한 수준)뿐이었습니다. 이는 에디터에 통합하기에도, 저희만의 자체 모델을 학습시키기에도 턱없이 부족한 양이었습니다. 부족한 부품들을 기존 방식으로 재구축하는 것은 무의미한 노력이 될 것이었습니다. 최신 기술을 활용해 아예 새로운 기술 스택을 연구·개발하더라도 어차피 비슷한 시간이 소요되는 반면, 훨씬 더 뛰어난 결과물을 얻을 수 있기 때문입니다. 이에 따라 저희는 기존 엔진의 독특한 음색을 유지하기 위해 핵심 특징들은 가져오되, 완전히 새로운 버전의 엔진을 설계하고 구현하는 데 시간을 투자했습니다. 과거에 쓰인 보코더 기술은 더 이상 사용 불가능하다고 판단되었고, 이 부분을 새로 개발하는 데 전체 개발 시간의 상당 부분이 소요되었습니다. HiFi-GAN과 같은 기존의 시판 솔루션을 그대로 가져다 쓰는 대신 이 작업을 직조해낸 이유는, 저희 엔진만의 독창적인 음색 프로필을 확보하여 차별성을 갖추기 위함이었습니다. 향후 선보일 조음 엔진은 첫 번째 엔진 버전에서 영감을 얻되, 대대적인 최적화와 최신 모듈 구성 요소들을 적용하여 제작될 예정입니다.
새로운 엔진의 샘플을 들어볼 수 있나요?
현재 보코더 구현은 아직 개발 및 최적화 단계에 있습니다. 거의 완성 단계에 있지만, 실험 및 최적화를 위해서는 최근 새로운 시스템을 확보하기 전까지는 보유하지 못했던 컴퓨팅 자원이 필요합니다. 현재 보코더는 저해상도에서 작동하며, 고해상도로 확장하는 작업을 진행 중입니다. 만족스러운 결과물이 나오는 대로 공개하겠습니다. 보코더가 완성되었다고 해서 엔진 전체가 완성되는 것은 아니지만, 보코더 개발이 완료되면 발음 엔진 개발 속도가 크게 빨라질 것입니다.
40개 이상의 언어 지원은 어떻게 된 건가요?
언어 개수 문제가 개발 진척을 막았던 적은 사실상 단 한 번도 없었습니다. 다만 시간이 흐르며 저희는 해당 언어를 대표할 원어민이 없는 상태로 해당 언어(특히 이전에 상업용 음성합성 제품이 없었던 언어)를 출시하는 것은 커뮤니티에 대한 예의가 아니라고 판단했습니다. 이 규칙의 유일한 예외는 Oliver, Aurum, Audine입니다.
현재 저희 엔진에는 10개 언어(영어, 프랑스어, 포르투갈어, 독일어, 일본어, 한국어, 러시아어, 스페인어, 중국어 간체, 폴란드어)가 완전히 통합되어 있습니다. 저희는 당장 지원 언어를 확대할 계획이 없으며, 그보다는 핵심 엔진 자체를 완성하는 데 모든 역량을 집중하고자 합니다.
공개 또는 비공개 베타 테스트가 예정되어 있나요?
엔진과 에디터가 적절한 상태가 되면 비공개 베타 테스트를 진행할 예정입니다. 이때 비공개 베타 테스트 참여권을 구매하신 분들의 기록을 검토하여 초대장을 발송할 것입니다. 공개 베타 테스트 진행 여부는 현재 논의 중입니다.
지금까지 만들어낸 결과물과 앞으로 나아갈 방향에 대해 만족하시나요? 프로젝트가 결국 세상에 출시될 수 있을 거라고 느끼시나요?
현재 진행 중인 엔진 재개발 작업은 1년도 채 안 되는 짧은 개발 기간 동안 만족스러운 결과를 보여주고 있습니다. 지금으로서는 정확한 개발 일정을 확정하기 어렵지만, 시간이 지나면 핵심 기능들이 대부분 유지된 상태로 사람들이 사용할 수 있는 엔진이 완성될 것입니다.
새로운 UI를 살짝 엿볼 수 있을까요?
다음 업데이트에는 프론트엔드 개발자인 Aku의 개발 블로그와 함께 새로운 UI의 사진이 포함될 예정입니다.
팀을 돕기 위해 자원봉사를 할 수 있나요?
저희 팀은 자립적으로 운영되지만, 자원봉사 관련 정보는 곧 개설될 디스코드 서버에 게시될 예정입니다.
어떤 보컬들이 예정되어 있나요?
현재 RVBY, Arctos, Imani, 그리고 더 많은 보컬들이 기획되어 있습니다.
이전에 관련된 서드 파티 및 스튜디오 중 어느 곳에서 여전히 협력하고 있나요?
현재 진행 중인 제품 개발에는 SoundCake Studio, Vrilliant, VirVox, Altvox와의 협력이 포함됩니다.
3.1.6. 반응
이 사건으로 VocaTone의 이미지는 나락으로 떨어졌고, 서구권 음성 합성 엔진 팬덤에 심각한 타격을 끼쳤다. 무엇보다 Maghni AI가 기대를 받았던 이유는 OLIVER, Sweet ANN, BIG AL, RVBY, Aurum[10] 등 서양 VOCALOID 캐릭터들의 신규 라이브러리를 기대하는 유저들이 많았기 때문인데 이 사태로 OLIVER를 비롯한 VocaTone의 라이브러리는 제작 중단되었고, Sweet ANN, BIG AL은 개발 여부는 커녕 저작권조차 불확실한 상태라는게 알려져 팬덤에게 크나큰 배신감을 주었다. 권리와 개발 여부가 확실한 건 RVBY가 유일하다.그러나 한편으로는 사실 Maghni AI가 처음 발표되었을 때부터 의구심을 갖는 시선도 많았다.
- 첫 발표 당시 보여준 것은 엔진 이름과 캐릭터뿐, 음성 샘플이나 GUI, 구동 화면을 공개하지 않았다. 즉 믿을 만한 '개념 증명(Proof of Concept)'이 없다. 상식적으로 펀딩을 받기 전에 엔진이 제대로 작동하는지, 어느 정도 구현이 되었는지를 보여줬어야 했는데 그걸 안 했다.
- 발표 당시 16가지 언어를 지원 한다고 했고, 펀딩 페이지에는 무려 40개의 언어를 지원한다고 발표했다.
Maghni AI가 의심을 받았던 가장 큰 이유다. VOCALOID가 최대 5개의 언어[11]를 지원하고, Synthesizer V가 처음에는 3개(일본어, 영어, 중국어)만 지원했던 걸 생각하면 40개는 말도 안 되는 계획이다. 결국 현 개발팀이 10개로 줄였지만 이것도 많다.
- 아직 출시도 안된 엔진인데 준비된 캐릭터의 수가 지나치게 많다.
- 당초 발표된 캐릭터는 테스트 라이브러리 2명 + VocaTone의 OLIVER, Audine, Aurum과 미공개 캐릭터 2명 + MISBAH STUDIOS의 GLASSIA, GABRIEL, DONOVAN + Altvox 캐릭터 3명 + SoundCake Studio의 Arctos, Imani + 구 PowerFX의 Sweet ANN, BIG AL, RVBY + 시키네 세이지(指揮音精二)와 기타 미공개 캐릭터 2명[12] + VirVox Project의 시라카미 코타로(白上虎太郎)까지 해서 무려 22명이다.
- Crescendia의 Q & A에서 두 회사와의 관계를 끊겠다고 밝혔기 때문에 MISBAH STUDIOS의 라이브러리는 사실상 취소되었고, VocaTone의 라이브러리도 제작이 중단된 상황이라, 남아있는 서드 파티 캐릭터는 VRILLIANT의 RVBY, SoundCake Studio의 Arctos와 Imani, VirVox Project의 시라카미 코타로, Altvox 캐릭터 3명으로 총 7명이다.
- 테스트 라이브러리, Sweet ANN과 BIG AL, 시키네 세이지, 기타 미공개 캐릭터들의 개발 여부는 불명.
현 개발팀이 엔진 이름을 바꾸고, 어떻게든 개발을 완수하겠다고 의지를 표명하긴 했으나, 최신 엔진이 개발한지 겨우 8개월 밖에 안됬다는 것과 10개 언어 지원 등 현 개발 상황을 보면 여전히 회의적인 시선이 많다.
4. 외부 링크
5. 둘러보기
||<tablealign=center><tablebordercolor=#fff,#1f2023><color=#fff><tablewidth=100%>
음성 합성 엔진 개발 기업
||- [ 펼치기 · 접기 ]
- ||<tablebgcolor=#ffffff,#1c1d1f><width=20%> ||<width=20%> ||<width=20%>
||<width=20%> 파일:인터넷 로고.png
||<width=20%> ||
파일:TOKYO6 ENTERTAINMENT.png
파일:attachment/PowerFX/K-387.png
[1] Maghni AI 발표 당시 페이스북 글을 보면 "Maghni AI는 3년간 발전해왔다"고 나와있다. 즉 이 기간까지 포함하면 7년 이상이다. 다만 이후에 드러난 정황을 보면 이는 처음부터 거짓일 가능성이 크다.[2] AURUM의 음성 제공자인 Denev가 미성년자 성착취 및 그루밍 범죄로 물의를 일으킨 유저와 친분이 있으며 그를 방조했다는 의심을 받자 자신의 X 계정을 삭제한 일이 있었다. 이 일에 대해 VocaTone은 별다른 반응을 보이지 않았다.[3] 펀딩 공개 당시 PowerFX의 Sweet ANN, BIG AL, Ruby로 추정되는 실루엣이 있었고 이중 한 명은 진짜로 Ruby로 밝혀졌다. PowerFX가 2025년 폐업해서 이들은 더 이상 신규 라이브러리가 나올 수 없었기에 보컬로이드 팬들의 기대를 모았다. 그러나 폐업 이후 PowerFX 캐릭터들의 권리를 누가 가지고 있는지 명확히 밝혀지지 않았다. Ruby는 VRILLIANT가 저작권을 쥐고 있어서 권리 주체가 명확하지만, Sweet ANN과 BIG AL의 경우, 2025년 PowerFX 웹사이트 폐쇄 당시 운영자측에서 캐릭터의 권리에 대해 언급하지 않아 권리 여부가 불확실하다. 또한 언제부턴가 Ruby의 공식 사이트가 폐쇄되어 취소된 것 아니냐는 의혹이 제기 되었지만 이후 VRILLIANT에서 호스팅 전환 과정 오류로 끊긴거라며 조만간 고치겠다고 밝히며 일단락되었다.[4] 나탈리아의 글에는 개발자의 이민법 문제와 크라우드펀딩을 별개라고 서술되어 있지만 이후 SUZlE-P의 폭로로 애초에 펀딩 목적 자체가 개발자에게 돈을 주려고 한 것임이 드러났다.[5] AI 음성 합성에서 '추론(Inference)'은 학습이 완료된 AI 모델을 가져와 실제로 목소리를 출력하는 재생기 역할을 한다. 하지만 정작 중요한 학습 코드와 핵심 구동부 소스 코드가 없어 유명무실한 상태다.[6] 그러나 후에 Crescendia 측의 글을 보면 라이브러리의 권리는 확실히 Crescendia에게 있지만, 캐릭터 저작권에 대해서는 언급하지 않아 사실인지는 확실하지 않다.[7] 이는 ExpressiveLabs의 Mikoto Studio다. 실제로 VocaTone 공식 사이트에 Mikoto Studio와 파트너십을 맷고 있다고 써있다. 나탈리아는 ExpressiveLabs는 이 일과 아무 상관없다고 언급했다. 다만 Mikoto Studio의 사이트에 VocaTone이 '테스터 및 후원자' 목록에 있는 걸 보면 파트너십이라기 보단 단순한 테스터/후원자 중 하나에 가깝다. 또한 Mikoto Studio 개발자는 VocaTone은 그저 Mikoto Studio용 라이브러리를 제작하는 서드파티라고 밝혔다.#[8] 2020년에는 CeVIO AI와 Synthesizer V AI가 발표되어 본격적으로 AI 엔진으로 전환하려는 시기였다. 처음엔 연결형 음성 합성으로 개발했었지만 음성 합성의 트렌드가 AI 엔진으로 넘어가기 시작하자, AI 엔진으로 노선을 변경한 것으로 보인다.[9] 즉 수익금 자체는 의도대로 쓰였다. 하지만 Barham은 돈만 받아 먹고, 결과물은 보여주지도 않은 채로 그대로 도망가버렸고, VocaTone은 방관만 하고 있었으니 사실상 먹튀나 다름없다.[10] Aurum은 원래 'Ausgris'라는 이름으로 VocaTone에서 아주 잠시만 개발 중이었던 보컬로이드였다. Maghni AI가 발표된 후로 출시될 기회가 생겼지만, 결국 빛을 볼 기회를 잃었다.[11] 일본어, 영어, 중국어, 한국어, 스페인어.[12] 시키네 세이지는 서양 UTAU 캐릭터다. 이를 보아 나머지 캐릭터들도 UTAU 캐릭터일 가능성이 크다.