⑲6건
온디바이스·로컬 추론
- 2026-08-31HUMAIN·Qualcomm — LEAP 2026(리야드)에서 Horizon Ultra AI PC 공개 — Snapdragon X2 Elite(18코어 Oryon CPU·Adreno GPU·Hexagon NPU) 기반으로 CPU·GPU·NPU에 AI 작업을 분산. Windows판은 2026-09-20부터 기업 구매 개시, HUMAIN OS 버전은 2027년 예정. 보도자료에 NPU TOPS 수치와 가격은 없음 출처사우디 국부펀드 계열사가 온디바이스 AI PC를 주권 AI 스택의 단말로 내세움 — 로컬 추론이 지정학적 조달 품목이 되는 국면
- 2026-05-19Google (AI Edge) — LiteRT-LM 정식 출시(GA) — iOS 네이티브 Swift API와 WebGPU 가속 JavaScript API 추가. Android CPU·OpenCL GPU·NPU, iOS Metal, 브라우저 WebGPU 지원. Gemma 4 기준 Android GPU 디코드 52 tok/s, iOS GPU 56 tok/s, MacBook Pro M4 Max 웹 76 tok/s, Multi-Token Prediction 최대 2.2배, iOS 메모리 607MB 출처온디바이스 런타임이 모바일 OS를 넘어 브라우저까지 같은 스택으로 덮는 단계. 수치는 벤더 자체 측정
- 2026-05-05Google (Chrome) — Chrome 148 스테이블에서 Prompt API를 웹에 공개 — 확장 프로그램은 Chrome 138부터 스테이블. 브라우저 내장 Gemini Nano에 웹페이지가 직접 접근하며 텍스트·이미지·오디오 입력과 정규식·JSON 스키마 응답 제약을 지원. 요구 사양은 여유 공간 22GB, VRAM 4GB 초과 또는 RAM 16GB·4코어 이상 출처온디바이스 모델이 앱이 아니라 웹 플랫폼 API로 노출된 스테이블 채널 사례. 모델 배포와 용량 관리의 책임이 브라우저 벤더로 넘어간다
- 2025-11-28Liquid AI — LFM2 기술보고서 발표 — 350M~8.3B 계열로 확장(밀집 350M·700M·1.2B·2.6B, MoE 8.3B 총/1.5B 활성), 10~12T 토큰 사전학습, 32K 컨텍스트. 엣지 지연·메모리 제약을 건 하드웨어-인-더-루프 아키텍처 탐색으로 설계했다고 기술. LFM2-2.6B가 IFEval 79.56%·GSM8K 82.41% 출처7월 릴리스의 후속 문서. 온디바이스 계열이 기술보고서 수준의 공개 문서를 갖춘 사례다
- 2025-09-10Arm — Lumex CSS 플랫폼 발표 — SME2를 넣은 C1 CPU 클러스터와 Mali G1-Ultra. KleidiAI를 PyTorch ExecuTorch·Google LiteRT·Alibaba MNN·Microsoft ONNX Runtime에 통합. AI 성능 최대 5배, 음성 워크로드 지연 4.7배 감소, 오디오 생성 2.8배를 주장 출처온디바이스 추론의 병목을 전용 NPU가 아니라 CPU 확장명령(SME2)으로 푸는 노선. 프레임워크 통합을 함께 발표해 실리콘이 아니라 소프트웨어 경로로 배포된다. 수치는 벤더 자체 주장
- 2025-07-10Liquid AI — LFM2 공개 — 350M·700M·1.2B 밀집 체크포인트를 게이트형 short convolution과 소수의 GQA 블록을 섞은 하이브리드 백본으로 발표. Apache 2.0 기반 라이선스(연매출 1,000만 달러 미만 상업 이용 허용). Galaxy S24 Ultra·AMD Ryzen HX370에서 ExecuTorch·llama.cpp로 측정해 Qwen3 대비 CPU 디코드·프리필 2배라고 주장 출처온디바이스를 사후 양자화의 결과가 아니라 설계 목표로 두고 하드웨어-인-더-루프로 아키텍처를 탐색한 상용 계열. 수치는 벤더 자체 측정이며 독립 검증이 아니다