Laboratório experimental para avaliação de modelos em tarefas de Infraestrutura e DevOps
Quick Start · Metodologia · Testes · Documentação · Segurança
Warning
Os resultados históricos incluídos em benchmarks/results/ não possuem, neste snapshot,
respostas brutas e manifesto completo suficientes para reprodução independente. Eles são
mantidos como material ilustrativo, não como ranking homologado ou evidência de produção.
O laboratório reúne datasets sintéticos, prompts públicos, notas técnicas e um runner para consultar endpoints OpenAI-compatible. O foco é organizar experimentos de modelos de código aplicados a Linux, redes, containers, automação e segurança defensiva.
flowchart LR
DATA[Datasets sintéticos] --> RUN[Benchmark runner]
MODEL[Endpoint do modelo] --> RUN
RUN --> RAW[Respostas brutas]
RUN --> METRICS[Métricas de transporte]
RAW --> REVIEW[Avaliação humana ou validador]
REVIEW --> REPORT[Relatório reproduzível]
| Área | Conteúdo | Estado |
|---|---|---|
| Dataset DevOps | 10 tarefas | Sintético |
| Dataset de rede | 7 tarefas | Sintético |
| Dataset de segurança | 8 tarefas | Sintético |
| Runner HTTP | OpenAI-compatible | Implementado |
| Latência e tokens | Coleta do endpoint | Implementado |
| Avaliação semântica | Não automatizada | Pendente |
| Sandbox de execução | Documentado conceitualmente | Não integrado ao runner |
| Fine-tuning LoRA | Notas e configs | Pesquisa |
| Resultados 7B/14B | Relatórios históricos | Não homologados |
O script benchmarks/run-benchmark.py mede:
- sucesso ou falha da requisição HTTP;
- latência total;
- tokens reportados pelo provider;
- tamanho da resposta;
- saída bruta e manifesto da execução.
Ele não prova que a resposta está tecnicamente correta. Correção, segurança, estilo e aderência ao resultado esperado exigem revisão humana ou um validador separado.
git clone https://github.com/SperryTecnologia/debuga-qwen-coder-lab.git
cd debuga-qwen-coder-lab
python3 -m venv .venv
source .venv/bin/activate
pip install -r requirements.txtExecute contra um endpoint OpenAI-compatible:
python benchmarks/run-benchmark.py \
--model Qwen/Qwen2.5-Coder-7B-Instruct \
--dataset benchmarks/devops-tasks.jsonl \
--api-url http://localhost:8000/v1 \
--output benchmarks/results/runsQuando necessário:
export LLM_API_KEY='chave-do-endpoint-de-teste'A execução cria:
manifest.json
responses.jsonl
metrics.csv
Um benchmark publicável deve registrar:
- data, commit e comando;
- modelo e revisão exata;
- engine, imagem e versão;
- GPU, driver e quantização;
- temperatura, seed quando suportada e limites;
- dataset e hash;
- respostas brutas;
- método de avaliação;
- limitações e falhas.
Consulte benchmarks/METHODOLOGY.md.
Os arquivos existentes em benchmarks/results/ são preservados para comparação documental,
mas não devem ser utilizados como prova de superioridade, decisão de compra ou capacidade de
produção. Novos resultados devem ser publicados em pastas de execução com manifesto e dados brutos.
debuga-qwen-coder-lab/
├── benchmarks/
│ ├── METHODOLOGY.md
│ ├── *.jsonl
│ ├── run-benchmark.py
│ └── results/
├── docs/
├── fine-tuning/
├── notebooks/
├── prompts/
├── scripts/
└── requirements.txt
| Documento | Conteúdo |
|---|---|
| Índice | Trilha de leitura |
| Ollama | Conceitos e limitações |
| GPU e virtualização | Laboratório de passthrough |
| NVIDIA Toolkit | Runtime de containers |
| Modelos | Critérios de comparação |
| API | Exemplos de uso |
| Sandbox | Segurança de ferramentas |
| Integração | Integração genérica de teste |
| Benchmarks | Práticas de avaliação |
| Troubleshooting | Diagnóstico inicial |
| Projeto | Papel |
|---|---|
| debuga-ai | Produto e documentação oficial |
| debuga-llm-stack | Arquitetura de referência |
| debuga-llm-gateway | Gateway local/cloud |
| debuga-vllm-engine | Serving GPU de referência |
| debuga-qwen-coder-lab | Este laboratório experimental |
Este repositório mantém a licença proprietária existente em LICENSE. A visibilidade pública não deve ser interpretada como uma licença open source. A adequação dessa licença ao objetivo público do projeto ainda precisa de decisão explícita do proprietário.
Modelos, bibliotecas e ferramentas de terceiros mantêm suas próprias licenças.
- Plataforma: debuga.ai
- Contato: contato@sperrytecnologia.com.br