오늘을 넘어 미래의 가치를 만드는 더존ICT그룹의 소식을 만나보세요.
로컬 모델이 앞선 보안 탐지 결과, 용도별 검증이 과제다
넘쳐나는 전 세계 AI 이슈, 핵심만 골라 ‘ONE AI’가 브리핑해 드립니다
보안 취약점 탐지와 게임 제작, 3D 설계에서 로컬 오픈소스 모델을 사용한 작업 결과가 구체적 수치와 함께 공개됐습니다.
한 개발자가 2주간 27개 깃허브 저장소를 대상으로 1,665회의 모델 실행과 1,067건의 보안 취약점 탐지를 진행한 결과를 공유했습니다. claude-opus-5는 8건의 탐지 경로 중 실제 취약점이 0건이었던 반면 deepseek-v4-flash는 6건 중 6건, glm-5.1은 5건 중 5건, gpt-oss-20b도 5건 중 5건이 실제 취약점으로 확인됐다고 밝혔습니다①.
DeepSeek-V4-Flash-Vision-Exp가 비전 기능으로 게임 화면을 직접 보고 텍스처와 애니메이션을 수정하며 이틀 만에 게임 월드를 제작한 사례가 공유됐습니다②.
llama.cpp와 FreeCAD를 MCP로 연동해 로컬 모델이 스크린샷을 확인하며 3D 프린팅용 기계 부품을 설계하는 9단계 워크플로우도 소개됐습니다③.
코딩 자동화에 대해서는 모델 자체보다 컨텍스트 관리와 툴링이 병목이라는 비판적 시각도 함께 제기됐습니다④.
공유된 사례들은 로컬 모델을 특정 업무에 직접 적용한 결과라는 점에서 같은 흐름에서 볼 수 있습니다. 보안 탐지에서는 상용 모델의 탐지 경로 8건 중 실제 취약점이 0건, 로컬 모델들은 제시된 건수 전부가 실제 취약점으로 확인됐다는 수치가 공유됐고, 같은 자료 안에서 코딩 자동화는 툴링 쪽이 문제라는 지적이 함께 나왔습니다.
모델 성능을 하나의 등급으로 판단하기보다 업무 유형별로 나눠 확인할 필요가 있습니다. 공유된 수치는 특정 개발자의 실험 환경에서 나온 값이므로, 자사에서 같은 작업을 대상으로 재검증할 기준선으로 삼는 편이 적절합니다. 로컬 모델 적용을 검토한다면 모델 선택과 별개로 컨텍스트 관리와 연동 도구의 성숙도도 확인 항목에 포함할 수 있습니다.
동일 모델을 두고 양자화 방식과 추론 엔진을 바꿔 측정한 수치가 잇따라 공유되며, 비교 대상이 모델 밖으로 옮겨졌습니다.
한 사용자는 자체 개발한 TAK(Task Aware Knapsack) 양자화로 Qwen 3.8 27B가 추론 벤치마크에서 82.81%를 기록해 Unsloth 양자화판의 77.34%를 앞서고 BF16 원본 83.59%에 근접했다고 밝혔습니다. 태스크 특화 코퍼스로 만든 imatrix와 텐서 단위 할당 최적화를 결합한 방식이라고 설명했습니다①.
다른 사용자는 Qwen3.5 0.8B를 CPU에서 구동하기 위해 커스텀 4비트 포맷(H128/Q4-G32-DOT4)을 만들어 llama.cpp의 Unsloth Q4_0 대비 프리필 2.9배, 배치-16 처리량 1.7배 향상을 달성했다고 공유했습니다②.
RTX 3080 2장과 128GB RAM, Xeon 6148 환경에서는 ExLlamaV3의 4.05bpw EXL3 퀀트가 Qwen-3.8-Flash-Next 기준 llama.cpp의 Q4_K_XL 대비 프리필 3.2배(약 870tps 대 270tps), 디코드 2배(평균 25tps, 최고 32tps 대 13tps) 빨랐다는 측정값이 공유됐습니다. 다만 같은 작성자는 GLM 5.3 Flash에서는 오히려 ExLlamaV3가 2배 느려, 우위가 모델과 하드웨어(특히 AVX2 지원 여부)에 따라 달라진다고 덧붙였습니다③.
Qwen 3.8 Next-Flash에 대해서는 단일 코딩 요청에 13분씩 사고하는 등 과도한 verbosity 문제가 지적됐습니다④.
공유된 측정값에서 결과를 가른 항목은 모델명이 아니라 양자화 방식, 추론 엔진, 하드웨어 구성이었습니다. 같은 모델에서 양자화만 바꿔 5%p 이상의 벤치마크 차이가 보고됐고, 엔진을 바꿨을 때는 모델에 따라 우위가 뒤집히는 사례도 함께 공유됐습니다. 실행 조건에 따라 결과가 달라질 수 있다는 사례로 볼 수 있습니다.
로컬 실행을 검토한다면 모델 선택과 함께 양자화 방식, 추론 엔진, 하드웨어의 명령어 지원 여부를 묶어서 확인할 필요가 있습니다. 한 조합에서 빨랐던 엔진이 다른 모델에서는 느렸다는 보고가 함께 나온 만큼, 실제로 사용할 모델과 장비 조합에서 재측정하는 절차를 두는 편이 적절합니다. 응답 길이나 사고 시간이 길어지는 특성도 사용성에 영향을 주는 확인 항목입니다.
여러 벤치마크의 개별 점수가 공개되는 가운데, 그 성적을 근거로 AGI라 부를 수 있는지에 대한 논쟁이 이어졌습니다.
GPT-6 Astra는 아파트 사진을 2D 평면도로 변환하는 Blueprint-Bench2에서 최고점을 기록했습니다. 이 평가는 50개 아파트를 순차 처리하며 약 20장의 실내 사진으로 방 배치와 상대적 크기를 추론하는 방식입니다①.
Astra Pro가 MineBench에서 정답이 있는 미로를 만들어낸 사례②와 실시간 팩토리오 플레이 장면③이 공개됐고, ClockBench 65.6%④, 도구 없는 MazeBench 13%⑤ 등 지표별 성적도 함께 공유됐습니다.
이런 성적이 이어지면서 일부 사용자들이 Astra를 AGI로 부르기 시작했으나, OpenAI가 공식적으로 Astra를 AGI라고 선언한 적은 없다는 점이 지적됐습니다⑥.
공개된 성적은 평가마다 편차가 큽니다. 최고점을 기록한 항목이 있는 한편 ClockBench 65.6%, 도구 없는 MazeBench 13%처럼 낮은 수치도 함께 공개됐습니다. 같은 모델을 두고 AGI 호칭이 커뮤니티에서 사용되는 동안 개발사 쪽의 공식 선언은 없었다는 점도 함께 확인됩니다.
모델 성능을 종합 호칭이나 대표 벤치마크 하나로 판단하기보다, 자사 용도와 가까운 평가 항목의 점수를 개별로 확인할 필요가 있습니다. 공개된 성적 중 어떤 항목이 실제 업무와 유사한 작업인지 확인하는 것을 비교 기준으로 삼을 수 있습니다.
벤치마크 지수가 새 버전으로 갱신되면서 오픈소스 모델의 순위가 재조정됐고, 일부 지표의 점수 차이를 두고 의문이 제기됐습니다.
Artificial Analysis Intelligence Index가 v4.3으로 갱신되면서 여러 오픈소스 모델의 순위가 재조정됐습니다①.
OpenBMB의 MiniCPM5-2B는 이전 버전인 v4.2 기준 15점을 기록해 40억 파라미터 이하 오픈웨이트 모델 중 최고 성적을 보였습니다②.
AA-Omniscience Index에서는 SOTA 오픈웨이트 모델들이 Gemini 3 Flash류보다 상대적으로 낮은 점수를 받아 그 원인에 대한 의문이 제기됐습니다③.
텐센트는 시각 문서 검색에 특화된 EVIE-8B와 경량 버전 EVIE-4.5B를 공개했습니다. ViDoRe V3 기준 nDCG@10 66.75점을 기록했고, EVIE-4.5B는 2048차원 단일 선형 프로젝션으로 64~2048차원까지 축소 가능한 Prefix-MRL 구조를 적용해 페이지당 32개 벡터, 100만 페이지당 3.81GiB로 인덱스를 압축했다고 밝혔습니다④.
같은 모델이라도 지수 버전과 평가 항목에 따라 위치가 달라진 사례가 함께 확인됩니다. 지수 개편으로 순위가 재조정됐고, 특정 지표에서는 오픈웨이트 모델의 점수가 낮게 나온 이유가 커뮤니티에서 논의 대상이 됐습니다.
공개 순위를 도입 근거로 볼 때는 어느 지수의 어느 버전 기준인지, 어떤 평가 항목이 포함됐는지를 함께 확인할 필요가 있습니다. 문서 검색처럼 용도가 뚜렷한 모델은 해당 과제 기준 점수와 인덱스 용량 같은 운영 조건을 비교 기준으로 삼을 수 있습니다.
불치 폐질환 치료를 위해 설계된 실험 약물의 임상시험에서, 원래 목표와 다른 지표의 변화가 함께 관찰됐습니다.
치료법이 없는 폐질환 환자를 위해 AI가 설계한 실험적 약물의 임상시험에서, 연구팀은 원래 목표였던 폐질환 치료 효과 외에 환자의 생물학적 나이 지표가 낮아지는 부수적 효과를 발견했습니다. 해당 지표는 약 6년가량 젊어진 방향으로 개선된 것으로 나타났으며, 이는 약물이 겨냥한 생물학적 경로가 노화 과정과도 연관되어 있음을 시사하는 결과로 해석되고 있습니다①.
이번 자료에서 확인되는 것은 AI가 설계한 약물의 임상시험에서 설계 목표와 다른 지표의 변화가 함께 관찰됐다는 사실입니다. 그 해석은 시사하는 수준으로 제시됐고, 노화 역전이 확정된 결론으로 제시된 것은 아닙니다.
AI 설계 결과물을 다룰 때 의도한 목표 외 영역에서도 측정값을 함께 확인하는 절차가 필요하다는 사례로 볼 수 있습니다. 다만 단일 임상시험의 관찰 결과이므로, 일반적인 효과로 확대하기보다 후속 검증 결과를 기다려 확인할 부분입니다.
본 콘텐츠는 공개된 사실 및 정보를 바탕으로, 당사의 편집 기준에 따라 생성형 인공지능(AI)에 의해 생성되었습니다. 최종 내용은 원문 대조 및 검수를 거쳐 발행하며, 참고한 각 자료의 저작권은 해당 저작권자에게 있습니다.
동결된 건강보험료율, 통일되는 청년 기준
2026.09.08급등한 코스피, 앞당겨진 수출 최대치
2026.09.07