공식 API 모델 구분을 바탕으로 만든 설명 모식도입니다. 구간의 폭은 실제 생성 시간이나 곡 길이의 비율을 나타내지 않습니다. 마지막 청취·편집 확인은 편집팀이 제안하는 작업 단계입니다.
Google이 2026년 9월 4일 음악 생성 모델 Lyria 3.5를 Gemini 앱과 Gemini API에 제공한다고 발표했습니다. 이번에 확인할 변화는 음악을 만들 수 있는 접근 경로와 곡의 구조를 지정하는 방식입니다. 9월 8일 브리핑에서는 공식 발표와 개발자 문서를 읽고, 실제 작업에 적용할 때 무엇을 먼저 확인해야 하는지 정리합니다. 이 글의 평가는 공개 사양에 대한 검토이며, 직접 만든 음원을 청취한 성능 평가는 아닙니다.
어디에서 사용할 수 있나
Google은 웹·모바일 Gemini 앱의 전 세계 사용자를 대상으로 제공한다고 안내했습니다. 앱에서는 장르를 고르거나 설명하고, 보컬과 연주곡을 선택하며, 템플릿과 짧거나 긴 트랙 옵션을 사용할 수 있습니다. Flow Music, Google AI Studio, Google Vids도 제공 경로에 포함됩니다. 이 안내만으로 모든 경로의 요금·생성 횟수·기능 구성이 같다고 판단할 수는 없습니다. Google의 Lyria 3.5 발표
이용 경로는 목적에 맞춰 고르면 됩니다. 음악 제작을 먼저 경험하려는 개인은 앱에서 확인하고, 자신의 서비스에 생성 기능을 연결하려는 개발자는 API 문서를 검토하는 순서가 자연스럽습니다. 다만 앱에서 보이는 선택 항목과 API의 모델 식별자는 같은 개념이 아닙니다. 아래 표는 개발자 가이드의 모델 구분을 정리한 것입니다.
30초 클립과 긴 곡을 구분하기
| 확인 항목 | Lyria 3 Clip | Lyria 3.5 |
|---|---|---|
| API 모델명 | lyria-3-clip-preview |
lyria-3.5 |
| 문서상 길이 | 30초 | 몇 분 길이, 프롬프트로 길이 지시 |
| 설명된 용도 | 짧은 클립·루프·미리듣기 | 절·후렴·브리지 등이 있는 긴 곡 |
공식 가이드는 클립 모델을 30초로 설명합니다. 이를 30초 미만의 임의 길이 생성으로 바꿔 해석하면 안 됩니다. 긴 곡 모델은 절·후렴·브리지처럼 구간이 나뉘는 음악에 맞춰 안내하며, 프롬프트에 길이나 구간별 시점을 넣는 방법을 제공합니다. 이것이 초 단위 편집 요구를 모든 결과에서 정확히 지킨다는 실측 보장은 아닙니다. 음악 생성 가이드의 모델·길이 설명
예를 들어 영상의 짧은 도입부에 넣을 음악과, 중간에 분위기가 바뀌는 곡 전체는 평가 기준부터 다릅니다. 도입부에서는 처음부터 필요한 분위기가 나오는지, 긴 곡에서는 후렴 진입과 마무리가 자연스러운지 들어볼 수 있습니다. 같은 입력으로 두 모델의 점수를 비교했다는 의미가 아니라, 편집팀이 제안하는 용도별 확인 방법입니다.
44.1kHz가 말해 주는 것
모델 카드는 텍스트·이미지 입력과 44.1kHz 스테레오 오디오 생성을 명시합니다. 사양 표에는 오디오 MP3와 가사 텍스트가 출력 유형으로 적혀 있고, 모델 버전은 프리뷰로 표시되어 있습니다. 모델 카드의 수정일은 9월 4일 UTC입니다. 발표일과 문서 수정일이 이번에는 같지만, 두 날짜의 의미는 구분해야 합니다. Lyria 3.5 모델 카드
44.1kHz는 소리를 표현하는 샘플링 빈도이고, 스테레오는 두 채널을 뜻합니다. 이 수치만으로 보컬 발음이 정확하다거나, 믹싱이 좋다거나, 작업물에 바로 납품해도 된다고 결론 내릴 수는 없습니다. 같은 출력 규격에서도 음악의 완성도는 달라질 수 있습니다. 원고의 음질 평가를 읽을 때도 파일 사양과 실제 청취 결과가 각각 제시됐는지 확인하는 편이 좋습니다.
이미지 입력 역시 활용 가능성과 결과 보장을 구분할 필요가 있습니다. 영상의 대표 장면을 텍스트 설명과 함께 전달하는 실험은 생각해 볼 수 있지만, 이미지의 특정 색이나 사물이 어떤 악기로 변환될지는 이 글에서 검증하지 않았습니다. 원하지 않는 분위기가 나오면 입력을 바꿔 다시 비교할 수 있도록 최초 조건을 기록해 두면 좋습니다.
처음 써 볼 때의 작은 실험
아래는 공식 성능 수치가 아니라, 편집팀이 제안하는 확인 순서입니다. 한 번에 많은 조건을 바꾸면 무엇 때문에 결과가 달라졌는지 판단하기 어려우므로, 먼저 한 작업의 요구사항을 적는 방식으로 시작할 수 있습니다.
- 목적을 한 문장으로 적습니다. 가상의 예로, 설명 음성을 가리지 않는 차분한 제품 소개 배경음이 필요하다고 정합니다. 필요한 길이와 보컬 유무를 함께 기록합니다.
- 첫 결과를 작업에 대입합니다. 음악만 따로 듣는 데서 끝내지 말고, 실제 사용할 설명 음성과 겹쳤을 때 말이 들리는지 확인합니다. 생성에 성공했는지와 용도에 맞는지는 별개로 기록합니다.
- 한 조건만 바꿉니다. 예를 들어 악기 구성을 바꾼 뒤 설명 음성을 더 잘 받쳐 주는지 비교합니다. 여러 번 시도했다면 채택한 결과뿐 아니라 재생성 횟수도 남깁니다.
- 채택 기준을 정합니다. 긴 곡이라면 구간 전환과 끝맺음, 짧은 클립이라면 도입과 반복 연결을 듣습니다. 원하는 부분만 얻었을 때 추가 편집에 든 시간도 포함합니다.
영상 제작자에게는 작업에 어울리는 음악 후보를 찾는 과정이, 작곡가에게는 편곡 방향을 비교하는 과정이 관심사가 될 수 있습니다. 이미 완성된 음원을 빠르게 골라 쓰는 방식이 자신의 작업에 더 잘 맞을 수도 있습니다. 어느 쪽이 시간을 줄이는지는 탐색·재생성·편집까지 포함해 판단해야 하며, 이 발표에는 그 절감률을 계산할 자료가 없습니다.
개발자는 예제의 모델명을 확인해야 한다
음악 생성 가이드의 표와 Python·JavaScript·REST 예제는 클립에 lyria-3-clip-preview, 긴 곡에 lyria-3.5를 사용합니다. 그런데 같은 문서의 여러 Java 예제에는 lyria-3-generate-001이 남아 있습니다. 이번 확인에서 발견한 것은 문서의 표기 차이이며, 특정 식별자로 실제 호출에 실패했다는 테스트 결과는 아닙니다. 예제를 사용할 때는 모델명과 응답 형식을 함께 대조해야 합니다. Google 음악 생성 가이드
또한 모델 카드에는 Live API 지원이 없다고 표시됩니다. 따라서 Lyria 3.5가 게임 상황에 즉시 반응하는 실시간 스트리밍 음악 엔진이라고 소개할 근거는 없습니다. API로 결과를 생성하는 기능과 실시간 재생 중 음악을 바꾸는 기능을 같은 것으로 설계하면 요구사항이 어긋날 수 있습니다. 지원 기능 표
서비스에 넣으려는 개발자라면 먼저 작은 요청으로 결과 저장과 재생 흐름을 확인하고, 자신의 계정에서 호출 한도와 비용을 별도로 확인하는 편이 좋습니다. 프리뷰라는 표시는 확인할 운영 조건이 있다는 뜻으로 읽을 수 있지만, 그것만으로 장애가 잦다거나 성능이 낮다고 단정할 수는 없습니다. 이 글에서는 유료 구독이나 API 호출의 가격 대비 성능을 계산하지 않았습니다.
어떤 사용자에게 의미가 있나
이번 발표는 Gemini 안에서 음악 후보를 만들어 보고 싶은 창작자와, 텍스트·이미지 입력을 활용하는 음악 생성 기능을 검토하는 개발자에게 살펴볼 만한 변화입니다. 반대로 음질·지연 시간·비용이 이미 검증된 운영 도구를 찾는다면 공개 사양만으로 결정을 끝내기에는 자료가 부족합니다.
Google은 이전보다 풍부한 편성과 표현력 있는 보컬을 강조하지만, 이번에 확인한 발표와 문서만으로 다른 서비스보다 우수하다고 순위를 매길 수는 없습니다. 가장 먼저 확인할 것은 자신의 작업 길이에 맞는 모델, 필요한 출력 방식, 그리고 결과를 채택하기까지 실제로 거친 과정입니다. 이 세 항목을 나눠 기록하면 출시 소식과 자신의 사용 판단을 연결하기가 쉬워집니다.
출처
- Google 공식 발표 — 2026년 9월 4일 발표
- Lyria 3.5 모델 카드 — 2026년 9월 4일 UTC 수정 표시
- 음악 생성 가이드 — 2026년 9월 4일 UTC 수정 표시
독자 의견
댓글 0
글에 대한 생각과 경험을 남겨 주세요. 서로를 존중하는 표현을 부탁드립니다.