KrukoAI Скачать
Сеть
Не требуется
Аккаунт
Не нужен
Модель
В телефоне
Наружу уходит
Три запроса ↓

Ваш ИИ. В вашем телефоне.
Ни аккаунта, ни сервера.

Модель скачивается один раз и остаётся в памяти телефона. Дальше чат, голос, текст с фото и PDF считает сам телефон — наших серверов не существует, и запросу некуда идти.

Скачать .APK

Android 7.0+ · arm64 · ~150 МБ · версия 1.1.0 · подписано сборкой из CI

Приложение ставится напрямую, не из Google Play, поэтому Android спросит разрешение на установку из неизвестного источника. Это ожидаемо: у сборки собственный ключ подписи. Сама модель в эти 150 МБ не входит — она скачивается отдельно внутри приложения.

Что уходит в сеть

Ровно три случая. Ни в одном из них не уходят ваши переписки, фотографии, документы или записи голоса — и ни один не идёт на наш сервер, которого не существует.

По вашей команде

Скачивание моделей

Срабатывает, только когда вы сами нажимаете «Скачать» у модели или включаете голосовой ввод. Уходит адрес файла, ваш IP и стандартный заголовок клиента — ровно то, что видит любой сайт, отдающий вам файл.

huggingface.co · github.com

Если включите кнопку

Веб-поиск

Кнопка «Поиск» в окне чата выключена по умолчанию и включается на одно сообщение. Включите — и текст этого сообщения уйдёт в DuckDuckGo, как при обычном поиске в браузере. При первом включении приложение показывает предупреждение и просит подтвердить.

html.duckduckgo.com

При запуске, сам

Проверка обновлений

Единственный запрос, который уходит без вашего участия. Передаётся версия приложения, модель устройства и случайный идентификатор установки: он создаётся на телефоне, ни с вами, ни с аккаунтом не связан и рекламным не является. Нужен, чтобы исправления доезжали без переустановки.

u.expo.dev

Чего не происходит

  • Содержания переписок, фото, документов и записей голоса нет ни в одном из трёх запросов.
  • Аккаунта нет: регистрация не предусмотрена, входить некуда.
  • Ни одного SDK аналитики в сборке — ни рекламного идентификатора, ни сбора статистики.
  • Ваш запрос не проходит через чужой фильтр: облачной модерации здесь нет.

Извините, я не могу помочь с этим запросом.

Запрос считает ваш телефон — фильтровать его некому.

Что умеет

Всё это работает в режиме полёта: включите его — и приложение не заметит разницы.

Чат с историей

Диалоги лежат в базе на телефоне: поиск по всем чатам, редактирование вопроса с перегенерацией ответа, экспорт и импорт. Синхронизировать не с чем — и не нужно.

Голос офлайн

Распознавание речи считает телефон, без интернета. Три размера модели — от 31 МБ. Настроено на русский язык.

Текст с фотографии

Сфотографировали документ — текст распознаётся на устройстве. Движок свой: готовые библиотеки кириллицу не поддерживают, поэтому пришлось написать свой.

Зрение

Зрячая модель смотрит на саму картинку, а не только на текст в ней: опишет, что на фото, и ответит по нему.

PDF в текст

Пришлите PDF — текст извлечётся на телефоне и уйдёт в модель. До 10 000 символов за один раз: это ограничение, а не недосмотр.

Свои модели

Каталог — не единственный вход. Можно добавить любую GGUF-модель по ссылке с Hugging Face. Замка нет.

Как это выглядит

Экран чата: ответ модели про фотосинтез, под ним счётчик токенов и скорость
Диалог. Внизу — счётчик токенов: видно, что ответ считался здесь же
Каталог моделей: строка про потолок памяти системы, карточка модели с размером, памятью и скоростью
Каталог. Потолок памяти назван прямо, у каждой модели — её аппетит
Список всех чатов с поиском по названию и первому сообщению; под каждым — имя модели
Все чаты. Поиск по истории, у каждого диалога — своя модель
Экран настроек: тема, размер шрифта, счётчик токенов, temperature, длина ответа и контекст
Настройки. Контекст, температура, длина ответа — всё под рукой
Экран данных приложения: чем занято место, размер моделей и кнопка удаления всех чатов
Данные. Видно, чем занята память, и что стереть всё можно одной кнопкой
Экран «О приложении» с текстом о том, что ответы считаются на телефоне и никуда не уходят
О приложении. Написано словами, без манифестов

Десять моделей

Каталог идёт от 0,5B до 14B и разбит на четыре раздела: «Рекомендуется для 6GB RAM», «Лёгкие и быстрые», «Рабочие лошадки» и «Флагманы». Модель скачивается один раз — дальше она работает без сети.

Модель Файл Память Скорость
Qwen2.5 0.5B Instruct 0,5 ГБ~1 ГБ10–20 tok/s
Llama 3.2 1B Instruct 0,8 ГБ~2 ГБ12–25 tok/s
Qwen2.5 1.5B Instruct 1,1 ГБ~2 ГБ6–12 tok/s
Qwen2.5-VL 3B Instruct · зрение 1,8 ГБ~5 ГБ2–5 tok/s
Phi-3.5 Mini Instruct 2,2 ГБ~4 ГБ5–10 tok/s
Ternary Bonsai 8B · тернарная 2,2 ГБ~2,7 ГБне измерена
Qwen2.5 7B Instruct 4,7 ГБ~6 ГБ2–4 tok/s
Llama 3.1 8B Instruct 4,9 ГБ~7 ГБ2–4 tok/s
Gemma 2 9B Instruct 5,8 ГБ~8 ГБ1–3 tok/s
Qwen2.5 14B Instruct 9,0 ГБ~12 ГБ1–2 tok/s

Почему память — это потолок

Прошивки Xiaomi, Redmi и POCO держат для сторонних приложений собственный потолок памяти — 6 ГиБ — и убивают всё, что его превысило, независимо от того, сколько памяти свободно. Строка из системного журнала выглядит так:

due to used too many pss resource, pss used: 8870217kb, pss threshold: 6291456kb

Телефон отдавал 8,8 ГБ, а приложение было убито — потому что порог 6. Считать «свободную память» тут бесполезно: свободной было полно.

Сколько остаётся модели

Из потолка вычитается полтора гигабайта на саму обвязку — среда исполнения, кэш контекста, буферы картинок. Бюджет берётся по более строгому из двух правил:

бюджет = min(ОЗУ − 3 ГБ; 6 − 1,5)

Потолок есть не на всякой прошивке, и величина его известна нам по одному измерению. Поэтому приложение не решает за вас молча: число показывается прямо в шапке каталога, а при запуске модель говорит, откуда оно взялось.

Под капотом: тернарные веса

Одна из десяти моделей в каталоге устроена иначе, чем остальные. О ней и о том, почему она вообще помещается в телефон.

Три значения вместо шестнадцати бит

Обычный вес модели — это число с плавающей точкой: 16 бит на каждый. У тернарной модели вес — одно из трёх значений. Каждые 64 веса занимают 18 байт: три значения плюс один общий масштаб на всю группу.

−10+1

18 байт на 64 веса ~ 2,3 бита — против 16 у обычной сборки

Что это даёт и чего стоит

Та же 8B в Q4_K_M
~ 4,7 ГБ
Она же тернарная
2,2 ГБ
Файл в байтах
2 310 125 920
Архитектура
qwen3, 36 блоков

Формат — Q2_0 с блоком 64 веса. Блок здесь не деталь: файл с блоком 128 та же сборка прочитает неверно, поэтому в каталоге стоит именно этот.

Честно о скорости

На телефоне эта модель ещё ни разу не запускалась — поэтому в каталоге напротив неё стоит прочерк, а не цифра. Мы не пишем tok/s, которых не измеряли. Формат новый (изготовитель пока рекомендует свою сборку llama.cpp), ускорения на графическом процессоре у него нет — считает процессор, как и у всех остальных моделей в каталоге.

Как поставить

  1. 01

    Скачать APK

    ~150 МБ, сборка под arm64. Поставить поверх прошлой версии можно: подпись не менялась, чаты и модели останутся на месте.

  2. 02

    Выбрать модель

    В приложении откройте каталог и скачайте модель — от 0,5 ГБ до 9 ГБ. Здесь пригодится Wi-Fi: файл идёт целиком на телефон. Закачку можно свернуть, она продолжится в фоне.

  3. 03

    Выключить интернет

    Дальше сеть не нужна. Включите режим полёта — и убедитесь сами: приложение ответит так же.

Требования: Android 7.0 и новее, процессор arm64. Модели крупнее 6 ГБ не запустятся на прошивках с потолком памяти — приложение скажет об этом до закачки, а не после.