본문 바로가기

반응형

전체 글

llama.cpp 플래그 하나를 2에서 6으로: speculative decoding 초안 길이를 실측으로 정한 기록 #DGXSpark #llamacpp #speculativedecoding #MTP #Qwen3 #로컬LLM #추론최적화플래그 하나를 2에서 6으로 올려서 45k 문서 처리를 65% 빠르게 만든 기록남의 셋업 문서를 읽다가 시작한 일이다. syv-ai/qwen38-27b-rtx3090이라는 저장소가 있고, RTX 3090 한 장에 Qwen3.8-27B를 올리는 설정을 정리해 둔 곳이다. 우리 장비도 아니고 우리가 쓰는 추론 엔진도 아니지만, 단일 사용자 구간을 다루는 장이 통째로 한 축에 대한 이야기였다. speculative decoding에서 초안을 몇 토큰까지 미리 뽑을 것인가 하는 값이다.그 장을 읽고 우리 서버 설정을 열어봤다. 해당 값이 2로 설정돼 있었고, 한 번도 바꿔본 적이 없었다. 모델을.. 더보기
DGX Spark에 음성 비서를 올렸다: TTS·LLM·STT를 전부 로컬로 구성한 기록 #DGXSpark #로컬LLM #음성비서 #TTS #STT #voicecloning #OpenClawDGX Spark에 음성 비서를 올렸다: TTS·LLM·STT를 전부 로컬로 구성한 기록DGX Spark 한 대에서 로컬 LLM 세 개를 상주시켜 쓰고 있었다. GB10에 통합 메모리가 달려 있고(사양 128 GB, 운영체제가 잡는 값 121 GiB), 생성용 26B 모델(16.8 GB), 오디오까지 받는 E4B 모델(4.2 GB), 그리고 별도 용도의 27B 모델(17.6 GB)이 각각 포트를 잡고 있는 구성이다. 이 셋의 가중치만 합쳐도 38.6 GB이고, 여기에 각 서버의 KV 캐시와 여유분이 얹힌다. 그 상태에서 남은 자리는 또 하나의 대형 언어 모델을 올리기에는 애매하고, 비워 두기에는 아까운 크.. 더보기
최신 30B급 dense 모델 Qwen3.8-27B와 Muse-Glimmer 성능 비교, 그리고 로컬 서비스 설정 🎯 최신 30B급 dense 모델 Qwen3.8-27B와 Muse-Glimmer 성능 비교, 그리고 로컬 서비스 설정8월 초에 30B급 로컬 모델 두 개가 나왔다. 메타의 Muse-Glimmer-30B와 알리바바의 Qwen3.8-27B다. 둘 다 dense 구조이고, 4비트로 양자화하면 파일 크기도 16~18GB로 비슷하다. 사양표만 보면 같은 자리를 놓고 다투는 모델이다. 그래서 둘을 DGX Spark 한 대에 번갈아 올려 같은 과제로 재봤다.결과는 사양표와 달랐다. 코딩 과제 54회 시행에서 통과 수는 54 대 52로 두 건 차이인데, 그 성적에 든 시간은 1,322초 대 343초였다. 메모리는 방향이 반대다. 토큰당 KV 캐시 비용이 Qwen3.8 쪽이 두 배 남짓 크다.결론부터 적는다. 30B급.. 더보기
Claude Code slack 환경에서 message injection 개선하기 #ClaudeCode #무인기동 #Slack #managed-settings #MCP #트러블슈팅 다섯 개찰구 중 넷은 저절로 열린다. 하나만 사람이 손을 대야 한다. "WARNING: Loading development channels." Slack 봇을 띄울 때마다 이 문구가 화면 한가운데 떠 있었다. 아래에는 선택지가 둘뿐이다. 1번 로컬 개발용으로 쓰는 중입니다, 2번 나가기. 사람이 1번을 누르기 전까지 세션은 그 자리에서 멈춰 있다.같은 PC에서 Discord 봇은 작업 스케줄러에 올라가 사람 없이 떴다. Slack 봇만 매번 손이 필요했다. 두 세션은 같은 CLI, 같은 권한 모드, 같은 계정으로 도는데 한쪽만 사람을 불렀다. 왜 한쪽만인가. Claude Code 무인 기동을 가로막.. 더보기
DGX Spark 한 대로 로컬 LLM 네 개를 직접 측정했습니다 #로컬LLM #DGXSpark #speculative_decoding #Muse_Glimmer #DeepSeek_V4_Flash #benchmark #llama_cpp 내 컴퓨터 안에서만 돌아가는 LLM으로 코딩과 agent 작업이 정말 되는지, 된다면 장비를 한 대 더 사야 하는지. 저희도 그게 궁금해서 이틀 동안 직접 측정했습니다. 여기서 agent라고 부르는 것은 사람이 시킨 일을 AI가 스스로 여러 단계로 쪼개서, 터미널에 명령을 내리고 그 출력을 읽어 다음 명령을 정해 가며 답에 도달하는 방식을 말합니다. 요즘 코딩 도구들이 대부분 이 방식으로 움직입니다.시험 대상은 새로 나온 모델 두 개에 저희가 쓰고 있던 두 개를 더해 모두 네 개이고, 장비는 DGX Spark 한 대입니다. 같은 고민을 하.. 더보기
결혼 10주년 기념 일본 중부 지방 여행 <1일차> 정말 오래간만에 가는 부부 해외여행 (출장 말고) 그리고 패키지 아니고 직접 준비해서 떠나는 여행 여러가지로 설래면서 날짜를 기다렸다. 1달 전에는 비온다는 예보가 유지되다가, 1주일 전부터 비가 안올거 같더니 3일전엔 비가 안오는걸로 예보가 바뀌었다. (우리 부부 둘중에 한명이 날씨 요정이 분명하다) 기뻐하면서 먼저 공항을 어떻게 가지? 가 고민이 되었다.지금 은평구에 거주중인데, 7시 30분에 뜨는 비행기를 타려면 모범 여행객이면 6시 반 전에 수속을 마치는게 좋다는 전제를 하고 도축 시간을 계산하니 몇가지 선택지가 나왔다.1. 불광역 공항버스 : 17000원 X 2 = 34000원2. 콜택시 : 7~9만원 3. 자차를 이용 장기 주차장 이용 : 톨비 4000원, 기름값, 주차비 36000원 약 토탈.. 더보기
결혼 10주년 기념 일본 중부 지방 여행 <계획 편> 결혼 10주년을 기념해서 일본 여행을 계획했었다. 여러가지 안이 나왔었는데, 여러 안중에서 내가 가고 싶다고 여러번 이야기 했던, 일본 중부 지방 여행 으로 결정했다.먼저 출장으로 일본 도야마에 가본 경험이 있었던 나는, 도야마에서 보았던 알펜루트 풍경이 인상적으로 남아 있었다. 아내도 일본 여행에 동의를 해줬고 처음에는 편하게 패키지를 한번 알아보려고 했었다. 그런데 모든 여행사에서 우리가 원하는 일정에는 최소 인원이 차지 않았다. 이번 추석 황금 연휴에나 인원이 충족하는것을 확인해 볼 수 있었다. 한번 시도했다가 거부당하고 깔끔하게 포기.그래서 직접 대중 교통을 타고 여행을 하기로 결정 하였다. 먼저, 일본 중부 알프스 코스는 기차로 여행하기에 매우 잘 구성이 되어 있어 기차 여행을 하기가 좋다. 먼.. 더보기
Anthropic의 Claude Chrome Extension: AI 자동화의 첫걸음 Anthropic은 Max 플랜 구독자들에게 Claude for Chrome 확장 프로그램의 연구 미리보기를 배포했다. 환영 이메일은 이 도구가 브라우저 내에서 폼 작성, 이메일 초안, 회의 일정 관리 등 작업을 지원한다고 밝히며, 사용 방법과 안전 가이드라인을 안내했다.- Anthropic에서 온 Chrome extension 안내 메일- 설치 후 확장 프로그램을 활성화하면 아래와 같은 안내가 표시된다. 각 단계를 따라 진행하며 기능을 확인할 수 있다. 본 기자는 waitlist를 통해 액세스를 받아 테스트를 진행하며, AI 자동화의 가능성과 한계를 점검했다.설치 및 초기 경험이메일에 따르면, Claude for Chrome은 Chrome Web Store에서 다운로드 후 브라우저 툴바에 고정(Pin).. 더보기

반응형