5P by GN⁺ | ★ favorite | 댓글 1개
  • OpenAI가 Codex Security의 CLI와 관련 도구를 오픈소스로 공개해 로컬 개발 환경과 CI에서 활용할 수 있게 함
  • 권한을 가진 저장소를 분석해 보안 취약점을 탐지하고 실제 악용 가능성을 검증하며, 관련 코드와 근거를 함께 제시함
  • 저장소 전체뿐 아니라 특정 경로/커밋 간 변경분/커밋하지 않은 작업 내용만 선택해 검사할 수 있음
  • 일반 검사보다 넓은 범위를 살펴보는 deep 모드와 프로젝트의 아키텍처/위협 모델/보안 정책을 반영하는 지식 기반을 지원함
  • 발견 항목의 심각도/신뢰도/증거/수정 방법을 구조화해 제공하고, 검사 이력을 비교하거나 CI 정책에 연결할 수 있음

취약점 탐지와 검증

  • 단순히 의심스러운 코드 패턴을 나열하는 데 그치지 않고, 코드 흐름과 주변 맥락을 분석해 실제 보안 문제인지 검증함
  • 발견 항목마다 다음 정보를 제공함
    • 취약점 유형과 심각도
    • 판단에 대한 신뢰도
    • 영향을 받는 파일과 코드 위치
    • 취약점으로 판단한 근거
    • 공격 또는 악용이 가능한 경로
    • 권장 수정 방법

검사 범위 선택

  • 작업 목적에 따라 분석 범위를 제한할 수 있음
    • 저장소 전체 검사
    • 특정 디렉터리나 패키지만 검사
    • 기준 커밋과 현재 커밋 사이의 변경분 검사
    • 스테이징되었거나 아직 커밋하지 않은 로컬 변경분 검사
  • 새로 추가되거나 수정된 코드만 검사할 수 있어 코드 리뷰와 배포 전 점검에 활용 가능함

Deep 모드

  • 일반 검사보다 더 많은 시간과 분석 작업을 사용해 저장소를 폭넓게 검토함
  • 여러 파일과 구성 요소 사이의 관계를 추적해야 하는 복잡한 취약점이나, 표면적인 패턴 검사로 찾기 어려운 문제를 분석하는 데 사용함
  • 저장소 전체뿐 아니라 지정한 경로에도 적용할 수 있음

프로젝트 지식 반영

  • 코드만 독립적으로 분석하지 않고 프로젝트에 제공된 문맥을 검사에 반영할 수 있음
  • 아키텍처 문서/위협 모델/보안 정책/내부 규칙 등을 기반으로 프로젝트에 특화된 위험을 판단함
  • 일반적인 보안 규칙으로는 정상처럼 보이지만 해당 시스템의 설계 원칙을 위반하는 코드도 검사 대상에 포함할 수 있음

결과 보고서와 검사 완전성

  • 발견된 취약점뿐 아니라 실제로 어떤 영역을 검사했는지도 기록함
  • 보고서에는 다음과 같은 검사 상태가 포함될 수 있음
    • 분석한 범위
    • 검사에서 제외된 영역
    • 완료하지 못하고 보류된 작업
    • 추가 확인이 필요한 질문
  • 이를 통해 결과 목록뿐 아니라 저장소가 어느 정도까지 검토되었는지 확인할 수 있음

지속적인 보안 검사

  • 이전 검사 결과를 다시 열거나 동일한 검사를 재실행해 발견 항목의 변화를 추적할 수 있음
  • 코드 변경 전후의 결과를 비교해 취약점이 새로 생겼는지, 수정되었는지 확인할 수 있음
  • 커밋 전 검사/코드 리뷰/여러 저장소 일괄 검사/CI 파이프라인의 보안 정책 검사에 연결할 수 있음

댓글과 토론

Hacker News 의견들
  • Promptfoo 공동 창업자이자 OpenAI에서 Codex Security CLI를 개발 중인 Michael임. 인증 문제를 알려줘서 고맙고, 이제 막 오픈 소스로 공개한 만큼 개선할 부분이 많아 제품도 빠르게 발전할 예정임
    사용해 보고 잘 작동하는 부분과 개선점을 알려주면 좋겠으며, 질문에도 답변하겠음
    CLI 문서: https://learn.chatgpt.com/docs/security/cli
    개발에 참여할 사람도 채용 중임: https://openai.com/careers/full-stack-software-engineer-cybe...

    • Codex 앱에서 5.6 Sol을 사용하면 취약점을 찾았다고 하면서도 그 내용을 알려줄 수 없다고 할 때가 있었는데, 현재의 취약점 탐지 가드레일은 어떻게 처리하는지 궁금함
    • CLI에서도 호출할 수 있는 것으로 아는 Codex 플러그인 대신 언제 이 도구를 사용해야 하는지 궁금함
    • OpenAI API 호출이 필수인지, 아니면 로컬에 OpenAI 호환 LLM 엔드포인트를 구축해서 사용할 수도 있는지 궁금함
    • “모든 것을 한 번에 처리해 프로그래머가 필요 없어질 놀라운 모델”이라는 홍보를 믿지 않는 이유가 바로 이런 모습임. LLM 연구소가 꾸준히 내세우는 주장과 달리, 이들이 직접 만드는 제품에서조차 인증 문제 같은 결함이 반복됨
      연구소의 자체 제품이 그 주장을 반박하고 있으므로 이를 믿는 사람이 줄어들면 좋겠음
  • 작은 저장소에서 실행했더니 거의 한 시간 뒤 중단됐고, Pro 요금제 주간 사용량의 절반을 소진함
    npx codex-security scan .을 실행해 최대 8개 작업자 슬롯으로 검사를 진행했지만, 52분 뒤 검사 중 저장소의 HEAD가 변경돼 결과를 저장할 수 없으니 새 검사를 시작하라는 오류가 발생함

  • 검사기 자체는 가장 흥미롭지 않은 부분이고, 실행 간 중복 제거, 오탐 추적, 예산 제어, CI 통과 여부 판단을 담당하는 주변 실행 체계가 진짜 제품임. 가장 흥미로운 혁신도 이 계층에서 나올 것으로 봄
    팀용 코딩 실행 체계인 AQ를 만들면서 똑같은 양상을 확인함. 처음에는 원시 모델 자체가 답이라고 생각했지만 금세 생각이 바뀌었고, 목적별 실행 체계는 예상보다 훨씬 강력함

  • 허용되지 않는 작업을 시도한다는 오류가 계속 발생해 매우 성가심. 어떤 유형의 프로젝트에서 작동하고, 코드 소유권은 어떻게 확인하는지 알고 싶음
    예를 들어 내가 작성한 패치가 포함돼 있어도 Linux 커널에서는 아예 작동하지 않는지 궁금함

  • AI 기업의 보안 도구는 방화범이 운영하는 소방서처럼 느껴짐. 유용하긴 하지만, 수많은 화재로 누가 이득을 얻는지 신경 쓰지 않기 어려움

  • 기존에도 Codex 플러그인으로 제공됐던 것으로 보이며, 핵심 소식은 OpenAI가 이를 오픈 소스화했고 개발도 빠르게 진행 중이라는 점임

  • 검사 중 CLI 출력에 흥미로운 정보가 거의 없음. 토큰 사용량이나 진행률 같은 정보를 보여주면 좋겠음

  • Alibaba도 CLI 기반 코드 검토 도구를 오픈 소스로 공개함: https://github.com/alibaba/open-code-review

    • 둘은 완전히 다른 제품
  • 이 도구가 분석을 위해 코드를 ChatGPT로 업로드하는지 궁금함. 일부 기업 프로젝트에서는 코드 외부 전송이 허용되지 않을 수 있음

    • ChatGPT 사용을 금지하는 기업이라면 ChatGPT 보안 분석 도구도 사용하지 못할 가능성이 큼
    • OpenAI로 데이터를 보내지 않는 GPT 모델 사용 방법으로 Amazon Bedrock을 선택할 수 있음
  • 이런 도구가 Snyk 같은 회사를 폐업하게 만들지 궁금함. 직장에서 Snyk를 사용하지만 만족스럽지 못했음

    • 경쟁 기준이 높아진 셈이며, 지속 가능한 전문성도 그에 맞춰 발전해야 함
    • 코드 조각 몇 개가 어떻게 Snyk를 폐업시킬 수 있는지 의문임