라이프스타일

Technology Innovation Institute, Falcon-Emirati-7B 공개: 에미리트 방언에 특화한 아랍어 AI 모델, 자체 평가에서 경쟁 모델보다 방언으로 더 자주 답한다고 주장

Technology Innovation Institute(TII)는 2026년 10월 6일, 에미리트(아랍에미리트) 구어 방언을 이해하고 구사하는 데 특화한 AI 언어 모델 Falcon-Emirati-7B를 공개했다. TII는 다른 아랍어 모델이 내용은 맞히면서도 문어체인 표준 아랍어로 답하는 경우가 많다고 주장한다. 이 글은 TII가 공개한 학습 방법, 평가 수치, 사용상 한계를 정리한 것이며, 모든 데이터는 TII의 일방적 주장이다.

읽는 데 약 10분

Technology Innovation Institute, Falcon-Emirati-7B 공개: 에미리트 방언에 특화한 아랍어 AI 모델, 자체 평가에서 경쟁 모델보다 방언으로 더 자주 답한다고 주장
사진: Mokaair (Original editorial artwork)

무슨 일이 있었나

Technology Innovation Institute(TII) 팀이 2026년 10월 6일 Hugging Face 블로그에 게시한 글에 따르면, 이 기관은 Falcon-Emirati-7B를 출시했다. TII는 이것이 자사 아랍어 모델 Falcon-H1-Arabic을 기반으로 한 방언 특화 모델이며, 어휘와 어조, 그 바탕에 깔린 문화적 맥락까지 포함해 원어민처럼 에미리트 방언을 이해하고 쓰는 것을 목표로 한다고 밝혔다.

TII는 출시 이유를 이렇게 설명한다. 현대 표준 아랍어(약칭 MSA)는 뉴스와 교과서에 쓰이는 문어이지만, 에미리트의 일상 대화와 유머, 협상, 이야기하기는 대부분 에미리트 방언으로 이루어진다. TII는 MSA만 아는 모델은 에미리트 방언 문장을 글자 그대로 번역해 내더라도 진짜 의미는 놓칠 수 있다고 본다. TII는 또한 Falcon-Emirati-7B를 자사 채팅 플랫폼에서 이미 사용할 수 있다고 밝혔다.

모델은 어떻게 만들어졌나

TII에 따르면 기반 모델 Falcon-H1-Arabic은 Falcon-H1 하이브리드 아키텍처를 채택해, 각 블록 안에서 텍스트를 처리하는 두 가지 기술인 상태 공간 모델(Mamba)과 Transformer 어텐션 메커니즘을 병렬로 작동시킨다. 이 시리즈는 파라미터 수에 따라 3B, 7B, 34B 세 가지 규모로 나뉘며(B는 10억을 뜻하고 숫자가 클수록 모델이 크다), 컨텍스트 윈도(모델이 한 번에 처리할 수 있는 텍스트 길이)는 최대 128K 및 256K 토큰(토큰은 모델이 텍스트를 나누는 단위)에 이른다. TII는 7B 버전을 선택한 이유로 품질과 학습·추론(모델이 실제로 작동해 답을 생성하는 것) 비용 사이에서 가장 좋은 균형을 이룬다는 점을 들었다. 34B의 비용은 방언 특화 채팅 모델에는 수지가 맞지 않고, 3B는 필요한 문화적·언어적 깊이를 담을 여유가 충분하지 않다는 것이다.

TII는 모델이 방언을 익히게 하는 데 세 가지 어려움이 있다고 지적한다. 에미리트 방언은 대부분 구어여서 인터넷상의 글로 된 텍스트가 MSA보다 훨씬 적고, 의미가 글자 그대로의 뜻이 아닌 경우가 많으며, 정해진 학습 레시피도 없다는 점이다. TII의 설명에 따르면 학습 데이터는 세 가지 출처에서 나왔다.

  • MSA를 번역하거나 옮겨 적은 것이 아니라 처음부터 방언으로 쓰인 에미리트 웹사이트와 포럼 콘텐츠.
  • MSA로 작성된, 에미리트의 문화와 전통, 언어에 관한 자료. 모델이 관련 주제의 배경을 이해하도록 하는 데 쓰였다.
  • 합성 데이터, 즉 다른 모델이 생성한 에미리트 방언 텍스트. TII는 생성 과정이 어휘 목록과 사전, 엄격한 문체 규칙의 제약을 받았으며 일상 주제의 범위를 보완하는 데 쓰였다고 밝혔다.

TII는 학습 과정에서 에미리트 원어민의 수작업 평가와 자동 채점을 함께 사용했다고 밝혔다. 자동 지표만으로는 자연스러움과 어조, 문화적 적합성을 측정하기에 부족하기 때문이라는 설명이다.

TII가 공개한 평가 결과

TII가 사용한 주요 벤치마크(서로 다른 모델의 능력을 비교하는 표준 테스트)는 Alyah다. TII의 설명에 따르면 이는 자사 팀과 커뮤니티가 공개한, 에미리트 방언 능력을 전문적으로 평가하는 객관식 테스트로 총 1,173문항이다. 문항은 에미리트 원어민이 직접 수집했으며 일상 인사와 예절, 비유적 언어, 전통 지식, 에미리트 시를 아우른다. TII는 Falcon-Emirati-7B가 Alyah에서 84.83%를 기록했다고 공개하며, 비교한 다른 모든 아랍어 및 다국어 모델을 앞섰고 그중에는 규모가 몇 배나 큰 모델도 여럿 포함된다고 주장했다. 이 비교에서 Falcon-H1-Arabic 시리즈는 제외됐다.

객관식은 모델이 정답을 알아볼 수 있는지만 보여 주므로, TII는 별도로 개방형 생성 평가를 진행했다. 동일한 1,173문항에 대해 모델이 직접 답을 쓰게 한 뒤 또 다른 AI 모델인 Gemini 3.7 Flash가 심사를 맡는 방식이다. 심사 모델은 두 가지를 따로 평가했다. 내용이 정확한지, 그리고 답이 정말로 MSA가 아닌 에미리트 방언으로 쓰였는지(이하 '방언 충실도')다. TII는 다른 모델들이 정답을 아는 경우가 많지만 에미리트 방언으로 질문을 받아도 기본적으로 MSA로 답한다고 밝혔다. TII는 또 문화 이해 테스트 ArabCulture-Dialogue의 에미리트 부분에서 283개 상황으로 네 개 모델을 시험했는데, 이 과제는 세 가지 선택지 중 문화적으로 가장 적절한 응답을 고르도록 요구한다.

자료 출처: TII가 Hugging Face 블로그에 공개한 자체 평가 결과로, 제3자 검증을 거치지 않았다.
모델방언 충실도(부분 점수, 즉 심사 모델이 정도에 따라 점수 부여)ArabCulture-Dialogue 에미리트 부분 정확도TII의 기타 설명
Falcon-Emirati-7B0.5285.57%Alyah 객관식 점수 84.83%
ALLaM-7B-Instruct-preview0.0583.39%일대일 비교의 인사 범주에서 Falcon-Emirati-7B와 0.50으로 동률
gemma-3-27b-it0.03TII가 이 테스트에 포함하지 않음개방형 생성 평가에만 참여
Jais-2-8B-Chat0.0273.79%인사 범주에서 0.54 대 0.46으로 Falcon-Emirati-7B에 근소하게 승리
Fanar-2-27B-Instruct사실상 0.0071.50%26.2%의 경우 답변을 거부, 정확성 0.27로 다섯 모델 중 최저

TII는 일대일 비교도 진행했다. Falcon-Emirati-7B와 다른 모델의 답을 나란히 Gemini 3.7 Flash에 건네고, 어느 답이 어느 모델에서 나왔는지 알리지 않은 채 더 나은 쪽을 고르게 한 뒤 범주별 승률을 집계한 것이다. TII는 Falcon-Emirati-7B가 대부분의 범주에서 세 경쟁 모델을 이겼다고 주장한다. '시와 창의적 표현' 범주를 예로 들면 Jais-2-8B-Chat을 상대로 0.69 대 0.31, ALLaM-7B-Instruct-preview를 상대로 0.66 대 0.34, Fanar-2-27B-Instruct를 상대로 0.88 대 0.12였다. '인사와 일상 표현' 범주에서는 TII에 따르면 Falcon-Emirati-7B가 Jais-2-8B-Chat을 상대로 0.46 대 0.54(열세), ALLaM-7B-Instruct-preview와는 0.50으로 동률이었으나, Fanar-2-27B-Instruct를 상대로는 0.70 대 0.30이었다. TII는 이 범주가 에미리트 방언과 MSA가 가장 많이 겹치는 영역이어서 일반 아랍어 모델도 여기서는 자연스럽게 들리기가 비교적 쉽다고 설명했다.

일반 독자에게 주는 의미

TII가 이번 결과에서 끌어낸 결론은 이렇다. 모델 규모 자체가 방언 능력을 가져다주지는 않으며, 방언 능력은 의도적으로 학습시켜야 하고 그 방언만을 위해 만든 데이터와 평가가 필요하다는 것이다. 일반 사용자에게 이는 한 가지를 일깨워 준다. 챗봇이 '어떤 언어를 읽고 이해하는 것'과 '현지인이 실제로 말하는 방식으로 응답하는 것'은 별개의 문제라는 점이다. TII의 주장이 맞다면, 모델은 내용을 맞히더라도 질문자가 쓰는 구어 방언이 아니라 문어적이고 격식 있는 문체로 답할 수 있다.

이번 발표가 겨냥한 것은 에미리트 방언이다. TII가 설명한 어려움(구어 방언의 글로 된 자료가 적고 의미가 문화적 맥락에 의존한다는 점)은 TII 자체 분석에서 나온 것이다. 독자는 어떤 언어 모델이든 현지화 능력을 평가할 때 누가 평가를 설계했는지, 누가 채점했는지, 원어민이 참여했는지를 눈여겨볼 수 있다.

자주 묻는 질문

Falcon-Emirati-7B는 무엇인가?

TII의 설명에 따르면 Falcon-H1-Arabic 7B 버전을 기반으로 한 방언 특화 AI 언어 모델로, 어휘와 어조, 문화적 맥락을 포함해 에미리트 방언을 이해하고 쓰는 것을 목표로 한다.

일반 아랍어 모델과 무엇이 다른가?

TII는 다른 모델들이 정답을 아는 경우가 많지만 에미리트 방언으로 질문을 받아도 기본적으로 현대 표준 아랍어로 답한다고 밝혔다. TII가 모델에게 직접 답을 쓰게 한 평가에서 Falcon-Emirati-7B의 '에미리트 방언으로 답했는가' 점수는 0.52였고, 나머지 네 개 평가 대상 모델은 약 0.00~0.05 범위였다. 이는 TII가 자체적으로 평가한 결과다.

이 평가 결과는 믿을 만한가?

현재 확인할 수 있는 것은 TII가 일방적으로 공개한 수치뿐이며, 해당 글에는 독립적인 검증이 첨부되지 않았다. TII의 설명에 따르면 Alyah 테스트는 자사 팀과 커뮤니티가 공개한 것이고, 일부 평가는 또 다른 AI 모델인 Gemini 3.7 Flash가 심사를 맡았다. TII는 학습 과정에서 에미리트 원어민의 수작업 검토가 있었다고도 언급했지만, 방언과 문화에 대한 판단이 주관적이라는 점도 인정했다.

일반인이 지금 사용할 수 있는가?

TII는 Falcon-Emirati-7B를 자사 채팅 플랫폼에서 이미 사용할 수 있다고 밝혔다. TII의 글은 모델 자체를 다운로드할 수 있도록 공개하는지 설명하지 않았고, 라이선스 조건도 언급하지 않았다.

모델에 알려진 한계는 무엇인가?

TII는 모델이 학습 데이터의 편향을 반영할 수 있으며, 드문 표현이나 지역색이 매우 강한 지칭, 또는 데이터가 부족한 경우에 오류를 낼 수 있다고 지적했다. TII는 민감하거나 공식적이거나 위험도가 높은 용도에 쓰기 전에 구체적인 상황에 맞춰 평가할 것을 권고한다.

왜 더 큰 모델이 아니라 7B를 선택했는가?

TII는 7B가 품질과 학습·운영 비용 사이에서 가장 좋은 균형을 이룬다고 밝혔다. 34B는 품질을 조금 더 끌어올릴 수 있겠지만 그 비용이 방언 특화 채팅 모델에는 수지가 맞지 않고, 3B는 필요한 문화적·언어적 깊이를 담을 여유가 충분하지 않다는 것이다.

이 주제의 최신 뉴스 보기

출처

라이프스타일