- Abu Dhabi의 TII가 Falcon 2 시리즈를 공개하며, 오픈소스 LLM 경쟁에서 다국어·멀티모달 모델을 전면에 내세움
- Falcon 2 11B는 5.5조 토큰으로 학습된 110억 파라미터 모델로, Hugging Face 리더보드에서 Meta Llama 3 8B를 앞섬
- Falcon 2 11B VLM은 시각 입력을 텍스트로 바꾸는 TII의 첫 멀티모달 모델이며, 이미지 해석을 여러 산업 분야에 적용할 수 있음
- 두 모델은 오픈소스로 제공되고 TII Falcon License 2.0을 따르며, 개발자가 더 가벼운 인프라에도 배포·통합하기 쉽게 설계됨
- TII는 Falcon 2를 여러 크기로 확장하고 Mixture of Experts를 검토해 성능과 응답 품질을 높이려 함
Falcon 2 공개와 모델 구성
- Technology Innovation Institute는 Abu Dhabi의 Advanced Technology Research Council 산하 응용 연구 조직으로, 2024년 5월 13일 대형 언어 모델 Falcon 2를 출시함
- 이번 시리즈는 두 모델로 구성됨
- Falcon 2 11B: 5.5조 토큰으로 학습된 110억 파라미터 LLM
- Falcon 2 11B VLM: 시각 입력을 텍스트 출력으로 변환하는 비전-투-언어 모델
- 두 모델 모두 다국어를 지원하며, Falcon 2 11B VLM은 TII의 첫 멀티모달 모델임
- TII는 Falcon 2 11B VLM을 현재 최상위 시장에서 이미지-투-텍스트 변환 기능을 가진 유일한 모델로 내세움
성능 비교와 활용 범위
- Falcon 2 11B는 Hugging Face의 오픈 LLM 평가 리더보드에서 사전학습 모델군과 비교됨
- Meta Llama 3 8B보다 높은 성능을 기록함
- Google Gemma 7B와 거의 같은 점수로 1위권에 위치함
- 점수는 Falcon 2 11B 64.28, Gemma 7B 64.29 수준임
- Falcon 2 11B 모델은 영어, 프랑스어, 스페인어, 독일어, 포르투갈어 및 여러 언어의 작업을 처리함
- Falcon 2 11B VLM은 이미지와 주변 환경의 시각 자료를 식별·해석할 수 있음
- 적용 분야로 헬스케어, 금융, 전자상거래, 교육, 법률 분야가 제시됨
- 문서 관리, 디지털 아카이빙, 문맥 색인화, 시각장애인 지원 같은 사용 사례도 포함됨
공개 방식과 다음 계획
- Falcon 2 11B와 Falcon 2 11B VLM은 모두 오픈소스로 제공되어 개발자가 접근할 수 있음
- 두 모델은 하나의 GPU에서도 효율적으로 실행될 수 있어 노트북과 기타 장치 같은 더 가벼운 인프라에 배포·통합하기 쉽다고 소개됨
- Falcon 2 11B는 Apache 2.0 기반의 허용적 소프트웨어 라이선스인 TII Falcon License 2.0으로 제공됨
- 책임 있는 AI 사용을 장려하는 허용 사용 정책을 포함함
- TII는 향후 Falcon 2 차세대 모델의 크기를 다양화하고 Mixture of Experts 도입을 검토함
- Mixture of Experts는 서로 다른 전문성을 가진 작은 네트워크를 결합해 더 정교하고 맞춤화된 응답을 만드는 방식임
- TII는 이 접근이 정확도를 높이고 의사결정을 가속할 수 있다고 봄
- 새 모델 정보는 FalconLLM.TII.ae에서 확인할 수 있음
댓글과 토론
Hacker News 의견들
-
벤치마크 결과가 Mistral 7B와 Llama 3 8B와 대략 비슷해 보이는데, 모델 크기가 커진 걸 감안하면 그다지 대단해 보이지 않음
https://huggingface.co/tiiuae/falcon-11B
https://huggingface.co/meta-llama/Meta-Llama-3-8B
https://mistral.ai/news/announcing-mistral-7b/- 맞음. Falcon-180b도 처음엔 과대평가가 많았지만, 커뮤니티가 곧 거의 쓸모없다는 걸 알게 됐고 일반적인 경우 더 작은 대규모 언어 모델들이 쉽게 이겼음
이번엔 falcon-11b가 Llama 3 8b보다 낫다고 주장하는데, 이미 여러 문제가 보임. falcon-11b는 Llama 3 8b보다 약 40% 커서 같은 크기 등급으로 비교하기 어렵고, 주장은 자동 벤치마크에 기대고 있는데 자동 벤치마크만으로는 그런 결론을 내리기 부족하다는 게 오래전부터 분명했음
일부 자동 벤치마크 점수는 Llama 3 8b보다 훨씬 낮고, 딱 하나의 벤치마크에서만 간신히 앞섬. 한 벤치마크에서 역대 최고처럼 보이게 만드는 건 가능하지만, 그게 좋은 모델이라는 뜻은 전혀 아님
사람 평가가 전혀 없는데도 의도적으로 성급한 주장을 담은 낚시성 제목을 썼고, Llama 3보다 낫다고 하면서 Llama 3 70b는 완전히 무시함
솔직히 tiiuae가 유용한 걸 내놓지 못하면서도 이런 오해를 부르는 낚시를 계속하는데 너무 많은 관심을 받는 게 짜증남 - 이들의 모델 전반이 그런 듯함. 크기는 정말 큰데, 들인 노력 대비 실제 성능 향상은 없음
정제한 웹 데이터셋이 심하게 검열되어 있어서 그 영향도 있을 수 있음. 도덕적으로 매우 보수적이라 포르노와 여러 주제를 완전히 배제함
그래서 콘텐츠를 너무 많이 걸러내고 비슷한 것만 더 넣는 게 일부 문제의 원인이라 해도 놀랍지 않음 - 비교할 지표가 맞지 않을 수도 있음
모델이 더 큰 건 사실이지만, 학습에는 Llama 3보다 더 적은 토큰이 필요했음. 공개 데이터셋이 없으면 제대로 비교하고 재현하기 어렵다는 게 문제임
모델 구조 때문인지, 데이터셋 품질 때문인지, 모델 크기 때문인지, 그 조합인지, 아니면 다른 이유인지 알기 어려움
- 맞음. Falcon-180b도 처음엔 과대평가가 많았지만, 커뮤니티가 곧 거의 쓸모없다는 걸 알게 됐고 일반적인 경우 더 작은 대규모 언어 모델들이 쉽게 이겼음
-
라이선스가 좋지 않음: https://falconllm-staging.tii.ae/falcon-2-terms-and-conditio...
추가 조항이 붙은 수정된 Apache 2 라이선스이고, 여기에 허용 사용 정책을 따라야 한다는 요구가 포함됨: https://falconllm-staging.tii.ae/falcon-2-acceptable-use-pol...
그런데 그 수정 Apache 2 라이선스에는 “허용 사용 정책은 수시로 업데이트될 수 있으며, 저작물이나 파생 저작물 사용이 업데이트된 정책을 준수하는지 확인하기 위해 정책이 호스팅된 웹 주소를 모니터링해야 한다”는 내용이 있음
현재 허용 사용 정책을 어떻게 보든, 앞으로 원하는 대로 바꿀 권리를 남겨두고 있고 사용자는 새 정책을 따라야 함
이런 라이선스를 OSI 정의와 호환되지 않는데도 오픈소스라고 부르는 흐름을 싫어하는 이유를 잘 보여줌- 기본적으로 사소하지 않은 용도에는 절대 쓸 수 없음. 언제든 통지도 없이 사용 사례를 금지할 수 있기 때문임
- “앞으로 원하는 대로 바꿀 권리를 남겨두고 있고 사용자는 새 정책을 따라야 한다”는 조항이 실제로 법정에서 유지될지 정말 궁금함. 관련 판례나 선례가 있는지 알고 싶음
- 이런 라이선스 장난은 처음이 아님. Falcon 1 때도 있었음. 노력은 높이 사지만 아직 수익화 여부와 방법을 계속 찾는 중처럼 보임
- 40b 모델은 순수 Apache로 보임
-
“새 Falcon 2 11B가 Meta의 Llama 3 8B를 능가하고, 선도적인 Google Gemma 7B 모델과 동급 성능을 낸다”는 문구가 있는데, Llama 3 8B가 거의 모든 지표에서 Gemma 7B를 앞선다고 강하게 알고 있었음
- 이건 채팅 튜닝 모델이 아니라 기반 모델 비교라는 점을 봐야 함. Falcon-11B에는 현재 채팅 튜닝 모델이 없기 때문임. Meta의 채팅 튜닝이 Gemma의 채팅 튜닝보다 나아 보임
그래도 Gemma 1.1 채팅 모델은 써본 바로 꽤 괜찮았고, Llama3 8B 채팅 모델이 확실히 더 낫다고 생각하긴 함
CodeGemma 1.1 7B는 관련 코딩 모델들과 비교해보면 특히 저평가되어 있음. 기반 CodeGemma 7B 모델은 코드 완성에서 테스트한 모델 중 손꼽히게 좋았고, 채팅 모델도 코드 작성에서 테스트한 모델 중 손꼽히게 좋았음
다른 모델들은 벤치마크를 더 잘 공략하는 것처럼 보이지만, 실제 사용에서는 CodeGemma만큼 버티지 못했음. CodeLlama3가 어떻게 나올지 기대되지만, 아직 존재하지 않음 - 일화적이긴 하지만, 내 경험상 Gemma는 완전히 쓸모없고 Llama 3 8b는 크기에 비해 예외적으로 좋음. Gemma가 Llama 3보다 앞선다는 생각은 이상하게 느껴짐. 일부 벤치마크에서 Gemma가 앞선다면 오염 같은 게 있는 게 아닐까 싶음
- 나도 그 점이 이상했음
요즘은 벤치마크를 많이 챙겨보지 않고, 농구에 완전히 전념하고 있음
참고로 나는 사실 Lebron보다 조금 더 잘함. Lebron은 내 세 살 딸보다도 훨씬 못하고, 나는 가끔 딸을 이김. 농구에서
- 이건 채팅 튜닝 모델이 아니라 기반 모델 비교라는 점을 봐야 함. Falcon-11B에는 현재 채팅 튜닝 모델이 없기 때문임. Meta의 채팅 튜닝이 Gemma의 채팅 튜닝보다 나아 보임
-
한숨, 이게 Spectrum Holobyte의 Falcon AT에 대한 글인 줄 알았음. MyAbandonware.com에 따르면:
“본질적으로 Falcon 2지만 어떻게든 다르게 마케팅된 Falcon AT는 Spectrum Holobyte의 혁신적인 하드코어 비행 시뮬레이션 Falcon 시리즈의 두 번째 릴리스다. Falcon 3.0이 현대 비행 시뮬레이션의 시작이라는 통념과 달리, Falcon AT는 이미 Falcon보다 크게 발전해 선명한 EGA 그래픽, 많은 현실적 옵션, 크게 확장된 캠페인을 갖췄다. 이 게임은 Falcon 팬들이 알고 사랑하게 된 훌륭한 튜토리얼, 다양한 임무, 정확한 비행 역학을 갖춘 현대 공중전 시뮬레이션이다. 여러 혁신 중에는 핫시트와 모뎀을 통한 놀라울 정도로 플레이 가능한 멀티플레이 옵션도 있다. 지금은 대체로 잊혔지만, Falcon AT는 Falcon과 Falcon 3.0 사이의 설명하기 어려운 간극을 설명해준다”- 새 제품 이름을 고전 컴퓨터 게임에서 따오는 흐름이 있는 듯함. 의도한 건 아닐 수도 있음. 방금도 여기서 Loom이라는 시스템 글이 있었는데, 고전 어드벤처 게임이 아니었음. 누군가 대규모 언어 모델이나 네트워킹 소프트웨어를 내놓고 Zork라고 이름 붙일 것 같음
- 지금 메인에 “F-16 Strike Eagle II reverse engineering” <https://news.ycombinator.com/item?id=40347662>도 올라와 있어서, 비슷하게 생각하도록 연상 작용이 걸리는 데 한몫함
-
“시각-언어 기능을 갖춘 유일한 AI 모델”이라는 문구가 무슨 뜻인지 모르겠음. 이게 대략 GPT-4 Vision과 LLaVA가 하는 일 아닌가?
- 처음엔 의미를 비트는 장난을 치는 줄 알았음
LLaVA가 언어-시각 모델이라는 식일 수도 있는데, 그렇게 해석해도 말이 되게 만들 수는 없었음
그냥 거짓말하는 걸지도 모름 - Claude 모델들도 전부 해당됨
- 처음엔 의미를 비트는 장난을 치는 줄 알았음
-
오픈 모델은 환영하지만, 여기서도 지적됐듯 Falcon 모델은 그다지 열려 있지 않음. 원래 Falcon도 벤치마크 수치가 시사한 만큼 잘 작동하지 않았음. 큰 진전처럼 밀어붙였지만, 출시 당시 경쟁 오픈 모델들을 앞선다고 느끼지 못했음
11B 모델이 “같은 등급”의 7B와 8B 모델을 앞선다는 홍보 문구는 조금 무리하는 느낌임. 지켜보겠지만, 로컬 추론으로는 분명 한번 써볼 생각임. 다만 직감으로는 미세조정된 llama 3 8B가 이번 주 기준 동급 최고일 가능성이 큼- 나도 원래 Falcon이 벤치마크 수치만큼 성능이 나오지 않는 걸 봤음. 파라미터 대비 토큰 관점에서 학습이 부족했던 것 같음. 그냥 400억 파라미터 모델을 갖고 싶었던 듯하고, Chinchilla 최적 이전 방식에 가까웠음
-
AI가 윤리적 감시를 적어도 일부 시도하는 민주국가뿐 아니라, 최악의 독재자들에게도 쓰일 거라는 이런 상기는 정말 오싹함
- MBZ는 MBS가 아니고, 사우디아라비아와 UAE는 다른 나라임. MBZ는 세계에서 가장 인기 있는 지도자 중 하나이고, 그의 국민은 가장 부유한 축에 듦
그의 나라는 경제가 여전히 꾸준히 성장하는 몇 안 되는 선진국 중 하나이고, 세계에서 가장 자유로운 이민 정책 중 하나를 갖고 있는데도 동아시아 밖에서는 가장 안전한 나라 중 하나임
최악의 독재자라기보다는 최고의 독재자 후보에 훨씬 가까움
- MBZ는 MBS가 아니고, 사우디아라비아와 UAE는 다른 나라임. MBZ는 세계에서 가장 인기 있는 지도자 중 하나이고, 그의 국민은 가장 부유한 축에 듦
-
이해하고 싶은 게 있음. 이 모델은 대부분 공개 데이터셋으로 학습했고, AWS 하드웨어를 썼고, 잘 알려진 알고리즘과 기법을 사용한 것 아닌가? 돈만 있으면 누구나 학습할 수 있는 다른 모델들과 어떻게 다른가?
회의적이거나 안티에 가까운 내 시선으로는, 이건 단지 과시이자 관련 있어 보이려는 노력으로 보임. 이런 시도에서 내가 못 보고 있는 게 더 있나?- 많은 모델이 이 범주에 속함. 주권성은 국가든 기업이든 어느 정도 가치가 있음. 경쟁의 위협도 모두에게 좋은 일임
최종 결과가 대부분 특별히 흥미롭지 않더라도, 이런 작업을 하는 사람들이 있는 건 반가움
- 많은 모델이 이 범주에 속함. 주권성은 국가든 기업이든 어느 정도 가치가 있음. 경쟁의 위협도 모두에게 좋은 일임
-
잠깐 동안 이게 고전 비행 시뮬레이션과 관련된 건 줄 알았음:
https://en.wikipedia.org/wiki/Falcon_4.0- SpaceX에도 Falcon 1과 Falcon 9 로켓이 있고, 제안됐지만 개발되지는 않은 Falcon 5도 있음
-
UAE야 좀 더 은근하게 해라 싶을 정도로 기사 편향이 터무니없음. “llama 3를 이김”은 의심스러울 만큼 도움 안 되는 요약이고, “시각-언어 기능을 갖춘 유일한 AI 모델”이라는 부분은 그냥 당황스러움