수노 스피치 베타, 영국 억양이 호주로 샌다…학습 데이터 비공개에 저작권 논란도 겹쳤다

Google 검색에서
선호 출처로 추가

선호 출처로 추가하면 Google 주요 뉴스에 위키트리 기사가 더 자주 표시됩니다.

수노, 음성과 배경음악을 한 번에 만드는 ‘스피치’ 베타를 모바일·웹 전체에 개방
최대 약 8분 분량 지원, 모델 학습 방식은 밝히지 않아

글과 분위기만 적으면 목소리와 음악이 함께 나온다 — 내용 이해를 돕는 AI 이미지
글과 분위기만 적으면 목소리와 음악이 함께 나온다 — 내용 이해를 돕는 AI 이미지

AI 음악 생성 서비스 수노(Suno)가 음성 생성 기능 ‘스피치(Speech)’의 베타 버전을 내놨다. 수노는 10월 1일(현지시각) 스피치를 발표하며 목소리와 음악을 하나의 트랙으로 함께 만들어내는 첫 오디오 모델이라고 소개했다. 약 한 달간 소규모 그룹을 대상으로 테스트를 거친 뒤 모바일과 웹의 모든 이용자에게 문을 열었다.

음성 합성 시장에는 이미 여러 경쟁자가 있다. 수노는 낭독 음성 위에 배경음악까지 한 번에 얹는 방식으로 차별화를 꾀했다. 다만 모델을 어떻게 학습시켰는지는 밝히지 않아 저작권 논란이 이어지는 상황에서 또 다른 논점을 낳고 있다.

Suno Music — How to Use Suno Speech (Beta)

글과 분위기만 적으면 목소리와 음악이 함께 나온다

스피치는 수노 안에 기본으로 들어간 기능이다. 이용자가 아이디어나 시, 직접 쓴 글을 입력하고 원하는 목소리와 음악 스타일을 설명하면 모델이 음성과 사운드를 동시에 생성한다. 수노가 공개한 활용 예시는 잔잔한 피아노 위의 잠자리 동화, 경기장 드럼을 깐 응원 연설, 속삭이듯 읽는 ASMR 장보기 목록 등이다.

더 버지(The Verge)에 따르면 사용 경로는 ‘Create’ 탭에서 스피치를 고르는 것이다. 모드는 두 가지다. ‘심플’은 ‘부하들을 독려하는 해적선장’ 같은 설명만 입력하면 되고, ‘어드밴스드’는 이미 정해 둔 대본을 직접 넣을 수 있다. 어드밴스드 설정에서는 AI 목소리의 성별과 말하기 스타일, 생성마다 달라지는 변주의 폭을 조절한다.

배경음악은 선택 사항이다. 토글로 간단히 끌 수 있어 깨끗한 음성만 원하는 경우에도 쓸 수 있다. 스피치의 최대 길이는 약 8분이다. 스피치는 안드로이드·iOS·웹 모두에서 쓸 수 있다고 명시했다.

최고제품책임자 “음악은 중심, 비전은 그 너머” — AI로 생성한 자료 이미지
최고제품책임자 “음악은 중심, 비전은 그 너머” — AI로 생성한 자료 이미지

최고제품책임자 “음악은 중심, 비전은 그 너머”

발표문은 수노의 최고제품책임자(CPO) 잭 브로디(Jack Brody)가 블로그에 쓴 글이다. 브로디는 “음악은 언제나 수노와 우리가 만드는 것의 중심에 있을 것”이라면서 “동시에 우리의 비전은 늘 인간 표현의 다른 형태로 뻗어 있었다”고 밝혔다. 이어 스피치를 “음성과 음악을 하나의 응집된 트랙으로 만드는 최초의 오디오 모델”이라고 불렀다.

수노는 출시를 ‘크리에이티브 엔터테인먼트’라는 틀로 설명했다. 이 범주가 다음 세대 소비자 기술을 규정할 것이라고 회사는 본다. 생일과 결혼식, 내부자만 아는 농담, 신앙과 예배, 자녀와 친구를 위해 이용자들이 만드는 노래처럼 스피치도 개인적인 창작물을 위한 또 하나의 캔버스라는 설명이다.

개발 과정에서 팀 내부의 실험도 있었다. 수노는 직원들이 친구가 보낸 문자 메시지를 극적인 낭독으로 바꾸고, 평범한 음성 메모에 웅장한 음악을 입히고, 자녀를 위한 명상과 시, 응원 메시지, 잠자리 동화를 만들어 봤다고 소개했다.

베타는 베타다…영국 억양이 호주로 샌다

수노는 한계도 숨기지 않았다. 브로디는 “베타는 정말로 베타를 뜻한다”며 “가끔 영국식 억양이 호주로 갔다가 돌아오기도 한다. 극적인 멈춤은 아주 극적일 수 있다”고 적었다. 이용자가 팀이 상상하지 못한 쓰임새를 거의 확실히 찾아낼 것이라고도 덧붙였다. 베타를 연 이유가 바로 그런 발견이라는 취지다.

수노는 이용자가 무엇을 좋아하고 무엇이 아직 잘 안 되는지, 커뮤니티가 다음에 무엇을 하고 싶어 하는지를 파악하며 스피치를 계속 개선하겠다고 밝혔다. 릴리스 노트도 이용자 피드백을 요청한다.

앞서 수노가 새 음악 모델 V6를 내놓은 뒤 일부 이용자 사이에서는 음질 불만이 터져 나왔다. 스피치는 그런 분위기 속에서 나온 새 기능이다. 두 사안의 직접적인 연관성은 소스에 나타나 있지 않다.

V6부터 스튜디오 2.0까지…올해 이어진 수노의 제품 확장

스피치는 올해 수노가 줄지어 내놓은 제품 가운데 가장 최근 항목이다. 수노는 9월 9일 워너뮤직그룹, BMG, 빌리브 등 업계 파트너와 함께 만든 V6를 선보였다. V6 계열은 세 가지다. 주력 모델 V6와 실험 성격의 ‘v6-wild’는 프로·프리미어 구독자가 쓸 수 있고, 더 빠르고 효율적인 ‘v6-mini’는 모두에게 열려 있다.

수노는 V6로 기존 곡의 일부를 일상 언어로 고치고, 여러 소스를 한 번에 합쳐 매시업을 만들고, 텍스트·오디오·이미지·영상으로 음악을 생성할 수 있다고 설명했다. 곡 전체를 다시 만들지 않고 가사 한 줄만 바꿀 수도 있다. 예로는 후렴을 가스펠 합창단이 부르게 바꾸는 작업이 제시됐다. 수노는 V6가 퍼지면 이전 모델을 퇴역시키고 플랫폼을 V6 세대로 완전히 옮길 계획이라고 밝혔다. 아티스트가 참여를 선택하고 대가를 받는 개별 아티스트 기반 옵트인(참여 선택형) 서비스도 개발 중이다.

그 이전의 흐름도 릴리스 노트에 남아 있다. 3월 26일 출시한 V5.5는 이용자가 자기 목소리를 녹음하거나 올려 곡에서 노래하게 하는 ‘보이스’, 이용자 카탈로그의 최소 6곡으로 맞춤형 모델을 학습시키는 ‘커스텀 모델’, 선호 장르·분위기·레퍼런스를 학습하는 ‘마이 테이스트’를 지원했다. 보이스는 8월 7일 iOS와 안드로이드에 상륙했다. 브라우저 기반 오디오 작업 도구 ‘스튜디오 2.0’은 8월 13일 프리미어 구독자에게 먼저 풀렸다. MIDI 편집, 오디오 효과, 내장 신시사이저, 채팅 바를 갖췄다. 9월 17일 업데이트에서는 MIDI-오디오 변환이 더 빠르고 원본에 충실해졌다.

경쟁 구도와 풀리지 않은 저작권 숙제

더 버지는 AI 음성 합성이 새롭지 않다고 지적했다. 딥마인드는 10년간 딥러닝 음성 합성을 실험해 왔고, 어도비는 텍스트 음성 변환 도구를 갖고 있다. 엘레븐랩스는 2023년 출시 이후 가장 잘 알려진 플랫폼 가운데 하나가 됐다. 수노는 “이제 막 뛰어든 것”이라는 평가가 나오며, 음악 생성기가 숱한 소송에 휘말린 만큼 플랫폼을 다변화하려는 시도일 가능성이 높다는 해석도 있다. 수노가 직접 밝힌 이유는 아니다.

The Decoder는 수노가 스피치 모델을 어떻게 학습시켰는지 밝히지 않았다고 전했다. 대형 음반사들이 이미 수노를 상대로 소송을 냈고, 뮌헨 법원이 최근 저작권 데이터 사용의 근거로 공정 이용을 인정하지 않는 취지로 수노에 불리한 판결을 내렸다고 이 매체는 설명했다.

수노는 업로드된 오디오 파일과 가사에서 무단 사용을 걸러내는 안전장치를 도입했다고 밝혔다. 또 아티스트·프로듀서·작곡가·연주자와 매주 작곡 캠프를 열어 창작 워크플로에서 수노를 어떻게 쓰는지 배우고 있다고 했다. 다만 스피치에 쓰인 학습 데이터에 대해서는 소스에 구체적인 설명이 없다.