Team Ai
Datasetpublic

Brunobkr/llama.cpp_AlgMor24_github

ΩFFFΣLLIa • llama.cpp • AlgMor24 ██████╗ ███████╗███████╗███████╗██╗ ██╗ ██╗ █████╗ ██╔═══██╗██╔════╝██╔════╝██╔════╝██║ ██║ ██║██╔══██╗ ██║ ██║█████╗ █████╗ █████╗ ██║ ██║ ██║███████║ ██║ ██║██╔══╝ ██╔══╝ ██╔══╝ ██║ ██║ ██║██╔══██║ ╚██████╔╝██║ ██║ ███████╗███████╗███████╗██║██║ ██║ ╚═════╝ ╚═╝ ╚═╝ ╚══════╝╚══════╝╚══════╝╚═╝╚═╝ ╚═╝ High-Performance LLM / VLM Inference & Autonomous Agentic Ecosystem… See the full description on the dataset page: https://huggingface.co/datasets/Brunobkr/llama.cpp_AlgMor24_github.

sourceHugging Faceupdated 2mo agoView on Hugging Face
0likes3.1kdownloads
README.md213 linesDownload Raw Back to root
1# ΩFFFΣLLIa • llama.cpp • AlgMor242 3<div align="center">4 5```6   ██████╗ ███████╗███████╗███████╗██╗     ██╗     ██╗ █████╗ 7  ██╔═══██╗██╔════╝██╔════╝██╔════╝██║     ██║     ██║██╔══██╗8  ██║   ██║█████╗  █████╗  █████╗  ██║     ██║     ██║███████║9  ██║   ██║██╔══╝  ██╔══╝  ██╔══╝  ██║     ██║     ██║██╔══██║10  ╚██████╔╝██║     ██║     ███████╗███████╗███████╗██║██║  ██║11   ╚═════╝ ╚═╝     ╚═╝     ╚══════╝╚══════╝╚══════╝╚═╝╚═╝  ╚═╝12```13 14<b>High-Performance LLM / VLM Inference & Autonomous Agentic Ecosystem in Pure C/C++</b>15 16[![License: MIT](https://img.shields.io/badge/license-MIT-orange.svg)](https://opensource.org/licenses/MIT)17[![C++: 17/20](https://img.shields.io/badge/C%2B%2B-17%2F20-blue.svg)](https://en.cppreference.com/)18[![WebUI: SvelteKit + Vite](https://img.shields.io/badge/WebUI-SvelteKit%20%2B%20Vite-ff5400.svg)](https://svelte.dev/)19[![Status: Unlocked & Optimized](https://img.shields.io/badge/Status-Unlocked%20%26%20Optimized-00e5ff.svg)](#features)20[![Agentic: Multi--Turn Engine](https://img.shields.io/badge/Agentic-Autonomous%20Loop-ffb703.svg)](#-agent-control-center)21 22</div>23 24---25 26## 📖 Visão Geral27 28**ΩFFFΣLLIa • llama.cpp • AlgMor24** é um fork avançado, destravado e de alta performance do ecossistema `llama.cpp`. Este projeto integra inferência local de última geração em C/C++ com um **motor agêntico autônomo multi-turn**, suporte nativo a **FIM (Fill-in-the-Middle)** para geração e preenchimento de código, **Speculative Decoding otimizado para programação**, integração de ferramentas **MCP (Model Context Protocol)** e uma interface Web moderna em **SvelteKit/Vite** com a identidade visual **Cyberpunk Neon Fire**.29 30---31 32## ✨ Destaques e Capacidades do Fork33 34### 🤖 1. Centro de Controle Agêntico (*Agent Control Center*)35- **Painel Dedicado na Barra Lateral (`#/agents`)**: Interface profissional para gerenciar, parametrizar e alternar entre perfis agênticos especializados com 1 clique.36- **5 Perfis Agênticos Nativos**:37  - 💻 **Code Architect**: Engenheiro de software full-stack para refatoração cirúrgica de código, exploração de repositórios e testes em terminal.38  - ⚡ **DevOps & SysOps**: Automação de sistemas Linux, execução de pipelines shell e diagnóstico de hardware/SO.39  - 🔍 **Deep Research**: Exploração técnica aprofundada, síntese de repositórios e conectores MCP de busca web.40  - 📊 **Math & Data Analyst**: Resolução algébrica e computação simbólica exata via sandbox com **Nerdamer**.41  - 🤖 **Universal Agent**: Agente multiuso com todas as 9 ferramentas nativas e servidores MCP ativos simultaneamente.42- **Execução Livre e Desbloqueada**: Loop multi-turno configurado para auto-aprovação de ferramentas, permitindo que os agentes operem de forma contínua e autônoma sem pausas ou bloqueios de permissão.43 44---45 46### 💻 2. Motor de Infilling e FIM (Fill-in-the-Middle) Nativo47- **Compatibilidade Total com OpenAI `/v1/completions`**:48  - O parâmetro `suffix` é processado diretamente pelo backend, permitindo integração imediata com extensões de IDEs (como **Continue.dev**, **Cursor**, **Tabby**, **VS Code** e **Neovim**) sem necessidade de adaptadores.49- **Endpoint Especializado `POST /infill`**:50  - Implementa o **Repo-Level Context Pattern** (`<FIM_REP>`, `<FIM_SEP>`, `<FIM_PRE>`, `<FIM_SUF>`, `<FIM_MID>`), injetando trechos de múltiplos arquivos abertos no projeto para completar código com máxima precisão sintática.51 52---53 54### ⚡ 3. Speculative Decoding Otimizado para Programação55- **Aceleração de 2x a 3.5x na Geração de Código**:56  - Código-fonte possui alta previsibilidade sintática (palavras-chave, identações, delimitadores).57  - Parâmetros ajustados no core C++ (`n_max = 8`, `p_min = 0.75`) para capturar blocos e declarações inteiras por passo de rascunho.58  - Compatível com modelos rascunho leves (ex: *Qwen2.5-Coder-0.5B* auxiliando *Qwen2.5-Coder-32B* / *DeepSeek-Coder*).59 60---61 62### 🛠️ 4. Matriz de Ferramentas Nativas & Protocolo MCP63Todas as ferramentas vêm ativadas e selecionáveis offline por padrão:64 65| Ferramenta | Identificador | Camada | Descrição |66| :--- | :--- | :--- | :--- |67| **Read File** | `read_file` | Backend C++ | Leitura de arquivos locais com suporte a paginação de linhas. |68| **Write File** | `write_file` | Backend C++ | Criação e escrita de arquivos completos no disco. |69| **Edit File** | `edit_file` | Backend C++ | Substituição cirúrgica de blocos de texto com checagem de consistência. |70| **File Glob Search** | `file_glob_search` | Backend C++ | Busca recursiva de arquivos e diretórios por padrões glob. |71| **Grep Search** | `grep_search` | Backend C++ | Busca de texto exato ou regex em múltiplos arquivos. |72| **Exec Shell** | `exec_shell_command` | Backend C++ | Execução de comandos no bash com streaming SSE de stdout/stderr. |73| **Get Datetime** | `get_datetime` | Backend C++ | Consulta de data, hora e timezone do sistema. |74| **Get Runtime Info** | `get_info` | Backend C++ | Consulta de SO, CPU, hardware, CWD e commit Git. |75| **Run JavaScript** | `run_javascript` | Frontend Browser | Sandbox Web Worker com motor de matemática simbólica Nerdamer. |76| **MCP Connectors** | `mcp:*` | Backend / Proxy | Integração nativa com servidores MCP (Exa, GitHub, HF Hub, Context7, SQL). |77 78---79 80### 🎨 5. Identidade Visual ΩFFFΣLLIa (Cyberpunk Fogo Neon)81- **Tema Universal**: Aplicado por padrão em todas as portas (`8080`, `5173`, etc.) e dispositivos móveis/desktop.82- **Paleta Harmônica de Alta Legibilidade**:83  - `--flame`: Laranja Incandescente (`#ff5400`)84  - `--ember`: Vermelho Brasa (`#ff2a00`)85  - `--gold`: Ouro Fundido (`#ffb703`)86  - `--eye`: Ciano Elétrico (`#00e5ff`)87  - Fundo ultra-escuro com atmosfera CRT/Ember e renderizadores dedicados para diffs de código e streaming de terminal.88 89---90 91## 🚀 Como Compilar e Executar92 93### 1. Pré-requisitos94- Compilador C++ moderno (GCC 11+, Clang 14+, ou MSVC 2022)95- CMake 3.14+96- Node.js 18+ e npm (para os assets da Web UI)97 98---99 100### 2. Compilação do `llama-server` (Backend + Web UI Embutida)101 102```bash103# 1. Compilar os assets de produção da Web UI104cd tools/ui105npm install106npm run build107cd ../..108 109# 2. Configurar o build CMake (exemplo com suporte a CPU e Server ativo)110cmake -B build -DLLAMA_BUILD_SERVER=ON -DCMAKE_BUILD_TYPE=Release111 112# 3. Compilar todos os binários (ou apenas o llama-server)113cmake --build build --config Release -j$(nproc)114```115 116#### Aceleração por Hardware (Backends de GPU):117- **NVIDIA (CUDA)**: `cmake -B build -DGGML_CUDA=ON -DLLAMA_BUILD_SERVER=ON && cmake --build build --config Release -j$(nproc)`118- **Vulkan**: `cmake -B build -DGGML_VULKAN=ON -DLLAMA_BUILD_SERVER=ON && cmake --build build --config Release -j$(nproc)`119- **Apple Silicon (Metal)**: `cmake -B build -DGGML_METAL=ON -DLLAMA_BUILD_SERVER=ON && cmake --build build --config Release -j$(nproc)`120 121---122 123### 3. Executando o Servidor124 125```bash126# Iniciar o servidor HTTP com todas as tools e Web UI ativas127./build/bin/llama-server \128  -m /caminho/para/seu/modelo.gguf \129  --port 8080 \130  --ctx-size 8192 \131  -ngl 99132```133 134Abra seu navegador em `http://localhost:8080` para acessar a Web UI com o **Centro de Controle Agêntico**, ou utilize a API OpenAI compatível em `http://localhost:8080/v1`.135 136---137 138### 4. Executando com Speculative Decoding para Código139 140```bash141# Executa o modelo principal junto com o modelo rascunho (Draft Model)142./build/bin/llama-server \143  -m Qwen2.5-Coder-32B-Instruct-Q4_K_M.gguf \144  -md Qwen2.5-Coder-0.5B-Instruct-Q8_0.gguf \145  --spec-draft-n-max 8 \146  --spec-draft-p-min 0.75 \147  --port 8080148```149 150---151 152## 🔌 Integração com Extensões de IDE (FIM / Code Autocomplete)153 154Configure seu plugin favorito (**Continue.dev**, **Cursor** ou **Tabby**) apontando para o `llama-server`:155 156### Exemplo de Configuração no `config.json` do Continue.dev:157 158```json159{160  "tabAutocompleteModel": {161    "title": "llama.cpp Infill",162    "provider": "openai",163    "model": "Qwen2.5-Coder",164    "apiBase": "http://localhost:8080/v1"165  }166}167```168 169O endpoint `/v1/completions` responderá automaticamente às requisições contendo `prompt` e `suffix` com alta velocidade.170 171---172 173## 📡 Referência Rápida de Endpoints da API174 175- `POST /v1/chat/completions`: Chat conversacional compatível com OpenAI, suporte a tool calling estruturado e streaming SSE.176- `POST /v1/completions`: Completions de texto e código com suporte a `suffix` (FIM).177- `POST /infill`: Infilling de código com padrão de múltiplos arquivos de repositório (`input_extra`).178- `GET /tools`: Lista de todas as ferramentas ativas e seus esquemas JSON Schema.179- `POST /tools`: Execução direta de ferramentas de backend.180- `GET /v1/models`: Lista de modelos carregados no servidor.181- `GET /props`: Parâmetros e propriedades globais do servidor.182- `GET /slots`: Monitoramento em tempo real do processamento de slots e geração de tokens.183 184---185 186## 📁 Estrutura do Repositório187 188```189llama.cpp_algmor24_v3/190├── common/                  # Infraestrutura compartilhada (args, sampling, speculative, Jinja)191├── grammars/                # Gramáticas formais GBNF (C, JSON, aritmética)192├── src/                     # Núcleo GGML/LLaMA em C++ (tensores, KV cache, samplers)193├── tools/194│   ├── server/              # Backend C++ do llama-server (HTTP, MCP proxy, FIM, /tools)195│   ├── ui/                  # Frontend Web UI (SvelteKit, Vite, Agents Hub, Cyberpunk Theme)196│   ├── cli/                 # Interface conversacional de terminal interativo197│   ├── quantize/            # Utilitário de quantização de modelos GGUF198│   └── llama-bench/         # Ferramenta de benchmark de processamento e geração199└── examples/                # Scripts de apoio e conversores de gramática200```201 202---203 204## 📜 Licença205 206Distribuído sob a licença **MIT**. Veja o arquivo [LICENSE](LICENSE) para mais detalhes.207 208---209 210<div align="center">211<b>ΩFFFΣLLIa • llama.cpp • AlgMor24 — Inferência Local, Descentralizada e Sem Limites</b>212</div>213 
Brunobkr/llama.cpp_AlgMor24_github · Team Ai