1P by GN⁺ | ★ favorite | 댓글 1개
  • Microsoft는 중국·러시아·이란 해커들이 해킹 능력을 높이려 자사 AI 도구를 사용한 사실을 포착했다고 발표함
  • Microsoft와 OpenAI는 Forest Blizzard, Emerald Sleet, Crimson Sandstorm, Charcoal Typhoon, Salmon Typhoon 등 국가 연계 공격자의 LLM 사용을 추적함
  • Schneier는 Microsoft나 OpenAI가 이를 알 수 있었던 이유를 챗봇 세션 감시로 판단함
  • 서비스 약관이 이런 관찰 권한을 포함했을 가능성이 있으며, 다른 AI 서비스에서도 비슷한 사용 행태 추적이 가능할 수 있음
  • AI 도구 사용자는 입력과 세션이 서비스 제공자에게 관찰될 수 있다는 점을 전제로 보안 민감도를 판단해야 함

Microsoft의 발표와 AI 도구 사용

  • Microsoft는 중국, 러시아, 이란 해커들이 자사 AI 도구를 사용해 해킹 능력을 개선하려 했다고 발표함
  • 해당 AI 도구는 문맥상 코딩 도구로 추정됨

OpenAI와 함께 추적한 공격자 그룹

  • Microsoft는 OpenAI와 협력해 탐지한 위협 인텔리전스를 공유함
  • 보고서에 따르면 국가 연계 공격자로 추적되는 그룹들이 LLM으로 사이버 작전을 보강함
    • Forest Blizzard
    • Emerald Sleet
    • Crimson Sandstorm
    • Charcoal Typhoon
    • Salmon Typhoon

챗봇 세션 감시에 대한 해석

  • Schneier는 Microsoft나 OpenAI가 공격자들의 AI 사용을 알 수 있는 유일한 방법이 챗봇 세션을 들여다보는 것이라고 판단함
  • 서비스 약관에는 그런 권한이 포함돼 있을 가능성이 있음
  • Microsoft와 OpenAI뿐 아니라 다른 AI 업체들도 사용 행태를 감시할 수 있으며, 이번 발표가 그 가능성을 확인한 사례로 다뤄짐

“spying” 표현에 대한 추가 해설

  • 2월 22일 편집으로 “spying”이라는 단어 사용에 대한 해설이 추가됨

댓글과 토론

Hacker News 의견들
  • 이걸 스파이 행위라고 부르려면 OpenAI API 약관을 다시 읽어야 함. “해커”라면서도 그 API를 계속 쓴다면 본인 책임에 가깝다
    OpenAI는 서비스 제공과 악용 탐지를 위해 API 입력과 출력을 최대 30일간 안전하게 보관할 수 있고, 30일 뒤에는 법적 보존 의무가 없는 한 시스템에서 제거한다고 되어 있음. 자격 있는 사용 사례라면 무보관(ZDR) 도 요청 가능함
    출처: https://openai.com/enterprise-privacy

    • 그래도 LLM 이전 온라인 서비스와 비교하면 개인정보 보호 정책이 유난히 나쁨
      예를 들어 Google Docs 정책은 https://support.google.com/docs/answer/10381817?hl=en에서 “Google은 사용자의 개인정보를 존중하며, 허가가 있거나 법적으로 요구될 때만 비공개 콘텐츠에 접근한다”고 말함
      LLM API 제공자에게도 같은 수준을 기대하는 건 합리적이며, 현재 이들이 대규모로 사용자를 감시하는 건 좋지 않다
    • Azure 약관은 다름. 데이터 보관도 거부할 수 있음: https://learn.microsoft.com/en-us/legal/cognitive-services/o...
    • 이런 조항은 그렇게 독특하지 않고 GCP, AWS, Azure를 포함한 클라우드 서비스 전반에서 꽤 흔함
      특히 머신러닝/AI 서비스 영역에서는 더 그렇고, 이 약관이 상식을 벗어난 수준이라고 보긴 어려움
  • “Microsoft가 AI 도구 사용자들을 감시한다”는 식으로 바꿔 말한 게 웃김. 실제로는 권위주의 국가의 적대적 정부가 AI 도구를 불법 활동에 쓰는 걸 Microsoft가 알아냈다는 이야기이고, 약관에 이런 추적이 명시되어 있으며 사용자는 “동의합니다”를 눌러야 함
    다음 제목은 “주요 TV 방송사가 Champions League 경기 중 축구 선수를 감시한다”쯤 되겠음

    • 우리에게 뻔하다고 해서 모두에게 뻔한 건 아님
      자극적인 제목도 정당하고, 흔하다는 이유로 받아들일 수 있는 것도 아님. 이런 일방적인 약관이 사용자에게 적대적인 행동을 가능하게 한다는 인식이 더 넓어지는 건 환영함
    • “예”를 누르지 않고도 그 도구들을 쓸 수 있나?
    • 게다가 Microsoft는 일부러 중국에 AI 연구소를 만들었음. 말도 안 됨
    • 무작위 “사용자”도 아니고 Bruce Schneier
    • 이 이야기가 별일 아닌 건 강하게 동의함
      다만 “Microsoft가 X를 감시한다” 같은 문장이 이제 자명한 명제로 받아들여진다는 점이 오히려 뉴스처럼 보임. 즉 “스파이가 X를 감시한다”는 말은 “Microsoft = 스파이”라는 뜻이 되고, 이 문맥만이 아니라 모든 문맥에서 그렇게 읽히게 됨
      이후로는 약관, 합법성, 불법성, 적대성, 우호성 같은 요소가 모두 부차적인 것이 되어버림
  • Google Bard, 아니 Gemini는 홈페이지에서 이 점을 아주 명확히 밝힘
    “Gemini Apps를 구동하는 기술을 개선하기 위해 사용자의 대화가 사람 검토자에 의해 처리됩니다. 검토되거나 사용되길 원하지 않는 내용은 입력하지 마세요.”
    대화만 해도 Gemini를 구동하는 머신러닝 모델을 포함해 Google 서비스 개선에 기여하며, 그 과정에서 훈련된 검토자가 대화를 처리해야 한다고 되어 있음. Gmail이나 Drive 같은 Google Workspace 콘텐츠는 Gemini 개선을 위해 검토되거나 사용되지 않고, 향후 대화가 검토되거나 머신러닝 모델 개선에 쓰이지 않게 하려면 Gemini Apps Activity를 끌 수 있다고 설명함

    • Google이 실제로 감시당하지 않는 사용 방식을 지원하는지 더 명확히 밝혀주면 좋겠음
      여기서는 절반 정도만 분명해 보임
  • 그냥 “Microsoft가 사용자를 감시한다”로 줄여도 됨
    최신 Microsoft 제품을 쓰면 많은 데이터를 보내고 있는 것이고, 거기서 끝임

    • 더 일반화하면 “모두가 사용자를 감시하고, 그게 인터넷이 작동하는 방식”임
  • 맞음. 악용을 감시한다고 꽤 명확히 말하고 있고 기간은 30일
    이게 왜 놀랄 일인지 모르겠음

    • 별일 아닌 사례 중에서도 꽤 온건하고 예상 가능한 편임. 호스팅된 백엔드에서 완전히 돌아가는 플랫폼을 쓰면 모든 것이 기록되고 저장될 수밖에 없음
      그에 비하면 Nvidia는 모든 제목 표시줄 값과 모든 클릭을 서버로 보내며, 거부해도 “필수”로 분류되어 전송됨. 지금 설치된 것 중 가장 침습적인 스파이웨어일 가능성이 큼
  • 여러 소셜 채널, 예를 들어 Facebook, Twitter, Instagram, 문자 등으로 AI 도구와 대화한다면 그 채팅은 해당 회사 직원뿐 아니라 그 회사의 마케팅 담당자와 외부 협력사도 적극적으로 읽고 있다고 봐야 함
    물론 계약으로 묶여 있겠지만, 사람들이 챗봇에 묻는 내용은 건강 정보, 성적 정보, 상담사에게나 말할 법한 매우 사적인 내용까지 포함됨. 그런데 그것이 22살 마케팅 인턴에게도 읽히고, 암호화되지 않은 평문이며, 복사/붙여넣기 가능하고, 사용자 이름/ID와 연결될 수 있음

  • Microsoft를 전혀 신뢰하지 않지만, OpenAI나 Google 등이 이런 행동을 한다는 소식을 들었을 때와 마찬가지로 놀랍지는 않음
    그렇다고 정당화되는 건 아님. 이제는 사용자가 명시적이고 철회 가능한 허가를 줄 때만 채팅 대화 열람이 가능하도록 모두가 개인정보 보호 입장을 바꿔야 할 때라고 봄

  • 이런 도구를 쓰는 사람은 자기 데이터가 전부 빨려 들어가길 자청하는 셈임. 이런 게 걱정된다면 로컬에서 구동되는 AI만이 사용할 만한 방식임

  • AI는 데이터 위에 만들어짐. 더 많이 감시할수록 AI 훈련용 데이터를 더 많이 얻고, 더 많이 훈련할수록 더 좋아지고 가치가 커지며, 더 많은 사람이 쓰게 되어 다시 데이터를 제공하는 순환 구조가 됨

  • 쉬운 분노 유도 소재임
    이런 플랫폼들은 전부 다음 모델을 훈련하려고 입력을 긁어가고 있음. 그렇다면 악용 탐지도 할 거라는 게 왜 뻔하지 않겠나