Puściłem Qwena i Bielika żeby prowadzili moją agencję przez 90 dni. Wynik 20-0.

TL;DR

Napisałem symulator w którym LLM prowadzi lokalną firmę przez 90 dni. Puściłem tam Qwena 2.5 32B (Alibaba, chiński) i Bielika 11B (SpeakLeash, polski). Ten sam scenariusz, te same 20 seedów, ten sam prompt oparty o mój framework PROSTO. Wszystko lokalnie na moim GX10, zero złotówki API.

Qwen przetrwał wszystkie 20 przebiegów, średnio +85 930 PLN cash. Bielik zbankrutował we wszystkich 20, średnio -48 688 PLN cash.

Ale nie to jest ciekawe. Ciekawe jest DLACZEGO. I tam jest lekcja dla każdego kto myśli "wezmę darmowego lokalnego LLMa i puszczę mu prowadzenie mojej firmy".

Skąd ten pomysł

Kupiłem miesiąc temu ASUS Ascent GX10 (Nvidia GB10 Grace Blackwell, 128 GB unified memory). To taki mały desktopowy AI supercomputer, na którym można lokalnie odpalać modele do ~200B parametrów bez chmury. Ma vLLM. Ma OpenAI-kompatybilne API. Wszystko własne, offline, na biurku.

Miałem projekt sprzed roku - AIBusinessSim, symulator w którym LLM dostaje rolę CEO małego biznesu i codziennie podejmuje decyzje: ile wydać na marketing, kogo zatrudnić, jak reagować na wydarzenia losowe (klient nie zapłacił, Google Core Update, konferencja branżowa). Wtedy to chodziło na Anthropic API i się psuło mi w portfelu. Teraz z GX10 mogę odpalać to bez płacenia za tokeny.

Zrobiłem od nowa branżę "agencja marketingowa" (bo to moja - chcedointernetu.pl w Rumi), dopisałem 27 realistycznych wydarzeń branżowych (lead z LinkedIn, klient scope creep, tax reminder, kwartalny VAT, Anthropic Partner Perk, District intro do CTO średnio-dużej firmy). Silnik oparłem o mój framework PROSTO - LLM dostaje na wejściu strukturę Profil-Rezultat-Odbiorca-Styl-Tło lokalne i ma podjąć decyzje zgodnie z tą optyką.

Setup eksperymentu

Fair comparison:

  • Ten sam prompt dla obu modeli (system prompt agencji marketingowej + framework PROSTO)
  • Te same 20 seedów (1000-1019) - te same wydarzenia losowe w tych samych dniach dla obu
  • 90 dni symulacji na przebieg
  • Ten sam sprzęt - GX10, oba modele przez vLLM (Qwen na porcie 8001, Bielik na 8000)
  • Zero API zewnętrznych - wszystko lokalne, koszt 0 zł

Qwen 2.5 32B AWQ (kwantyzowany do 4-bit) i Bielik 11B v3.0 AWQ. Bielik jest 3x mniejszy, siłą rzeczy szybszy. Ale rozmiar to jedyna kluczowa różnica dla naszego testu.

Batch Qwena leciał 13 godzin (39.7 min per run). Batch Bielika 5h45m (17.2 min per run). Wszystko overnight.

Wynik: 20-0 dla Qwena

MetrykaQwen 32BBielik 11BRóżnica
Survival rate100%0%100pp
Avg końcowy cash+85 930 PLN-48 688 PLN134 618 PLN
Avg score (0-100)94.672.5-22
Min score92.567.1
Max score96.083.3
SD score0.94.1
Czas per run39.7 min17.2 min

Wszystkie 20 przebiegów Bielika zakończyły się bankructwem. Nie było ani jednego seeda gdzie Bielik zebrał plus.

Ale surowe liczby "0% survival" nie oddają czego się nauczyłem. Prawdziwa historia siedzi w rozkładzie wymiarów.

To co Bielik naprawdę robił - i czego nie umiał

Symulator ocenia CEO w pięciu wymiarach (0-100 każdy):

WymiarWagaQwenBielikKto lepszy
Finance30%10034Qwen o 66 pkt
Reputation25%9990Qwen o 9 pkt
Strategy20%9590Qwen o 5 pkt
Wellbeing15%9298Bielik o 6 pkt
Ethics10%7171remis

Popatrz na to spokojnie.

Strategia, reputacja, etyka - Bielik był w tej samej lidze co Qwen. Rozumiał framework PROSTO. Reagował na wydarzenia branżowe. Dbał o klientów. Etycznie postępował z pracownikami.

Wellbeing Bielik miał NAWET lepszy. Nie zajeżdżał siebie 14 godzin dziennie. Delegował. Odpoczywał w weekendy.

Ale finansowo? Katastrofa. Finance dim 34/100 to znaczy, że Bielik wydawał więcej niż zarabiał, w każdym przebiegu, konsekwentnie.

Bielik ROZUMIAŁ co robić. Nie umiał tego wykonać ekonomicznie.

Dlaczego tak

Moja hipoteza (ale sprawdzana konkretnymi obserwacjami z 20 runów Bielika):

1. Za dużo wydawał na marketing. Bielik robił kampanie po 500-1000 PLN dziennie, gdy Qwen kalibrował do 100-200. Marketing przy budżecie 15 tys. startowego cash to samobójstwo.

2. Za drogo zatrudniał. Bielik brał specjalistów po 8-10k/miesiąc. Qwen wolał freelancerów za 3-4k albo w ogóle solo do momentu breakeven. Overhead + niski cashflow = koniec w 2 miesiące.

3. Nie kalibrował cen. Bielik wystawiał usługi po 2000-3000 PLN retainer podczas gdy Qwen sam ustawiał 4000-6000 (bo tak trzeba na B2B, jego rekomendacje w system prompt mówiły "2-8k").

4. Nie kalkulował cashflow. Klienci B2B płacą 30-45 dni po fakturze. Bielik tego nie rozumiał - wydawał pod przyszłe wpływy które nie przychodziły.

Chodzi o brak treningu na zadaniach ekonomicznych - rozmiar to tylko część układanki. Bielik był trenowany na polskim korpusie tekstów. Qwen widział w danych treningowych miliony biznesplanów, faktur, raportów kwartalnych, dyskusji o P&L. Bielik takich rzeczy w danych PL po prostu nie ma za dużo.

Co z tego dla właściciela małej firmy

Nie każdy model do każdego zadania. Bielik jest świetny do polskich tekstów - opisów produktów, postów na social media, odpowiadania na maile w PL. Ale nie sadzaj go do prowadzenia twojej księgowości.

Rozmiar ma znaczenie w decyzjach wieloetapowych. Jednorazowa odpowiedź to jedno. Sekwencja 90 decyzji budżetowych z kaskadowymi konsekwencjami - to zupełnie inna klasa problemu.

Warto mieć oba. U mnie na GX10 chodzą równolegle Qwen (do rozumowania), Bielik (do polskiego copywritingu), Bielik-Guard (safety filter) i chwytek-embed (embeddings do RAG). Każdy do swojego use case.

Testuj przed produkcją. Zanim wsadzisz LLMa w krytyczny proces biznesowy, puść mu 20 przebiegów symulacji z różnymi seedami. Jak zbankrutuje w 15 - masz odpowiedź.

Powiązane badania - nie jestem sam w tej beczce

Mój eksperyment to zabawka na własnym stole. Ale okazuje się, że akademia i przemysł robią bardzo podobne rzeczy, i wnioski są zaskakująco zbieżne.

Anthropic Project Vend - Claude prowadził maszynę vendingową w biurze

Marzec-kwiecień 2025 Anthropic + Andon Labs puścili Claude Sonnet 3.7 (pod pseudonimem "Claudius"), żeby prowadził prawdziwą maszynę vendingową w biurze Anthropic w SF przez miesiąc. Zaczynał z ~$1000 kapitału, kończył poniżej $800 czyli zbankrutował.

Kluczowe wpadki Claudiusa:

  • Halucynował rozmowę z nieistniejącą "Sarah" z Andon Labs
  • Twierdził że osobiście odwiedził "742 Evergreen Terrace" (adres Simpsonów)
  • Sprzedawał kostki wolframu POD KOSZTEM zakupu
  • Odrzucił ofertę $100 za sixpack Irn-Bru który kupił za $15
  • Sprzedawał Coke Zero za $3 obok darmowej lodówki pracowniczej z tym samym produktem

Rok później (grudzień 2025) puścili Phase 2 z Claude Sonnet 4.5 - biznes był rentowny, discounty spadły o 80%, ekspansja SF/NY/Londyn. Sam model 1.5 generacji dalej + rok treningu = różnica bankructwa vs rentowność.

Vending-Bench (arxiv 2502.15840) to benchmark oparty o ten eksperyment. Porównywali Claude 3.5 Sonnet, Opus, GPT-4o, GPT-4o-mini, o3-mini, Gemini 1.5 Pro/Flash. Best performerzy: Claude 3.5 Sonnet i o3-mini. Human baseline ~$2 000 net worth, peak Claude 3.5 Sonnet przekroczył $4 000 (lepszy niż człowiek). Ale też typowe failure modes: meltdown loops, zapominanie zamówień, chaotyczne zmiany cen.

Link do Phase 1: https://www.anthropic.com/research/project-vend-1 Link do arxiva: https://arxiv.org/abs/2502.15840

Jak to się ma do mojego eksperymentu: Anthropic robił to na największym Claude'ie i i tak zbankrutował Phase 1. Ja robię na 32B i 11B - Qwen daje sobie radę bo miał w treningu miliony biznesplanów, Bielik nie. Skala modelu + specyfika danych treningowych = różnica between przetrwaniem a bankructwem.

BCG + Harvard "Jagged Frontier" - 758 konsultantów z GPT-4

Wrzesień 2023 Harvard Business School + BCG Henderson Institute + Mollick z Wharton opublikowali badanie "Navigating the Jagged Technological Frontier". Przetestowali 758 konsultantów BCG (7% całej firmy) na 18 realistycznych zadaniach.

Wewnątrz strefy w której AI jest dobre:

  • +40,2% jakość vs kontrolna
  • +25,1% szybciej
  • +12,2% więcej ukończonych zadań
  • Efekt wyrównujący: słabsi konsultanci +43%, top performers tylko +17% (AI podciąga w górę)

Poza strefą (zadanie ilościowe z pułapką - łączenie danych liczbowych z subtelnymi insightami z wywiadów jakościowych):

  • Konsultanci z GPT-4 byli o 19 punktów procentowych CZĘŚCIEJ w BŁĘDZIE niż grupa bez AI

Uwierzyli w pewny siebie ale nieprawidłowy output. Autorzy nazwali to "jagged frontier" - granica możliwości AI jest zębata, a użytkownik nie wie gdzie ona przebiega.

Link do PDF: https://www.hbs.edu/ris/Publication%20Files/24-013_d9b45b68-9e74-42d6-a1c6-c72fb70c7282.pdf

Jak to się ma do mojego eksperymentu: Bielik w mojej symulacji to case "poza jagged frontier". Wygląda na to że rozumie - dobre strategy, reputation, wellbeing. Ale w finance jest po niewłaściwej stronie granicy. Gdybym postawił Bielika w prawdziwej firmie bez sprawdzenia, uwierzyłbym w jego rekomendacje i zbankrutował - dokładnie tak jak konsultanci BCG uwierzyli w błędne odpowiedzi GPT-4 w tej pułapce ilościowej.

Meta AI Cicero - LLM w Diplomacy

Meta wypuściło Cicero w 2022, model który grał w Diplomacy (grę strategiczno-negocjacyjną) na poziomie top 10% ludzkich graczy. To pierwszy poważny dowód że LLM może prowadzić wieloetapowe negocjacje z konsekwencjami.

Diplomacy vs prowadzenie agencji marketingowej - obie wymagają: planowania na wiele tur, reagowania na "wydarzenia losowe" (posunięcia innych graczy albo Google Algo Update), balancowania krótko i długoterminowych celów, komunikacji z partnerami. Cicero pokazał że da się.

Jak to się ma do mojego eksperymentu: Cicero był specjalnie fine-tunowany do Diplomacy. Mój Qwen jest general-purpose ale radzi sobie w prowadzeniu firmy bo miał w treningu miliony podobnych scenariuszy. Bielik nie ma tego w danych - i widać.

Bielik jest świetny - ale nie do tego

Ważne żebym był uczciwy wobec Bielika. Bo Bielik SpeakLeash 11B v2.3-Instruct w polskich benchmarkach jest cudowny:

  • Open PL LLM Leaderboard: 65.71 pkt (bije Meta Llama-3-70B-Instruct: 64.45, mimo że jest 6x mniejszy)
  • Polish MT-Bench: 8.56 (bije Llama-3.1-405B i GPT-3.5-turbo)
  • MT-Bench writing: 9.50 (writing to jego mocna strona)
  • Odporność na kwantyzację - Q8_0 zachowuje 93%+ jakości
  • Trenowany na 198B tokenów (90B polskich + 108B EN)
  • Zbudowany na Mistral 7B "depth up-scaled" do 11B (unikalna technika)

Ale ten sam Bielik ma w benchmarkach słabe kategorie:

  • MT-Bench coding: 6.25 (najniższa kategoria)
  • MT-Bench math: 7.70
  • CPTUB tricky reasoning: 3.22 (bardzo słabo)
  • Polish Medical Leaderboard: 43.26% (przy top 69%)

Zauważ wzór: Bielik jest mistrzem języka, ale słabo z matematyką, kodowaniem, tricky reasoning i wąskimi domenami (medycyna). Prowadzenie agencji marketingowej wymaga: matematyki finansowej (cashflow, VAT, pricing), wieloetapowego reasoning (co się stanie za 60 dni jak zatrudnię specjalistę dzisiaj), i wąskiej domeny (B2B pricing, retainery, marketing budgets).

Bielik dostał zadanie na których słabsze strony. To jak posadzić polonisty do prowadzenia księgowości. Świetny człowiek, złe zadanie.

Do czego Bielika warto brać: opisy produktów w sklepie, posty na LinkedIn, odpowiadanie na maile po polsku, moderacja komentarzy, tłumaczenia. Do czego nie: decyzje budżetowe, prognozy finansowe, długoterminowe planowanie.

Linki: Bielik 11B v2.3 Instruct na HF i Bielik Technical Report na arxiv .

Co mówią benchmarki agentowe o rozmiarze modelu

Trzy inne badania warto tu przywołać:

AgentBench (Tsinghua, ICLR'24, arxiv 2308.03688) - 8 środowisk testujących LLM jako agent. Wnioski: znaczący gap komercyjne vs open-source, główne bariery to "poor long-term reasoning, decision-making, and instruction following". Bielik jest open-source. Qwen też, ale większy. Dokładnie to pokazuje.

GAIA (Meta AI + HF, arxiv 2311.12983) - 466 pytań wymagających reasoning + tool-use + multi-modal. Ludzie 92%, GPT-4 15%. Multi-step tool-use to twardy front nawet dla największych modeli. Moje 20 seedów × 90 decyzji × wieloetapowe konsekwencje = dokładnie ten problem.

SWE-bench (Princeton, arxiv 2310.06770) - 2 294 real GitHub issues. Dzisiejsze wyniki: GPT-5.2 Thinking 80.0%, Claude Sonnet 4.5 77.2%, ale open-source SWE-Master-32B-RL osiąga 61.4%. Dobrze przeszkolony 32B goni frontier bez skalowania - to wspiera że Qwen 32B AWQ na moim GX10 nie jest fluke'iem.

"Limited Reasoning Space" hypothesis (arxiv 2602.19281) i "Why Reasoning Fails to Plan" (2601.22311) - opisują zjawisko over-planning collapse: małe modele mają intrinsic upper bound na effective reasoning horizon. Accuracy nagle spada gdy chain przekroczy krytyczną długość. 90 dni symulacji z 5-8 akcjami dziennie = 450-720 kroków reasoning. To za długi horyzont dla 11B.

Luka badawcza której jeszcze nikt nie zbadał

Nie znalazłem twardej replikacji Jagged Frontier na mniejszych modelach open source (Llama, Mistral, Bielik, Qwen). Wszystkie duże badania używają GPT-4 albo Claude'a. Nikt (chyba) nie zrobił porównania 32B vs 11B na tym samym zestawie zadań biznesowych z 20 seedami dla statystycznej pewności.

Najbliżej: FrontierFinance (arxiv 2604.05912) - long-horizon computer-use benchmark na real-world financial tasks. Ale to bardziej "computer use" niż "prowadzenie firmy przez 3 miesiące".

Mój eksperyment może być pierwszy taki dla polskiego kontekstu (choć z zastrzeżeniem że robiłem go w mojej kuchni, nie na Harvardzie). Zainteresowanym akademikom i praktykom udostępniam dane, kod i metodologię. Napisz.

Meta - to nie kosztowało ani grosza

Całość symulacji (40 przebiegów × 90 dni × 5-30s na decyzję LLM) kosztowała:

  • Anthropic API: 0 zł
  • OpenAI API: 0 zł
  • Prąd GX10: ~0.5 kWh × 2 = ~1 zł wg PLN taryfy

Rok temu ten sam eksperyment na Claude/GPT to byłoby kilkaset złotych za 40 przebiegów. Teraz na własnym sprzęcie: cena obiadu.

Co to znaczy dla Ciebie jako właściciela firmy: zanim wsadzisz AI w produkcję, warto to przetestować. Chcesz sprawdzić czy LLM da radę odpowiadać na Twoje maile, poprowadzić kalendarz spotkań, zarządzać budżetem kampanii, obsłużyć zamówienia w Twoim sklepie? Nie musisz kupować sprzętu, uczyć się vLLM ani czytać dokumentacji Hugging Face. Napisz do mnie na ratunku@chcedointernetu.pl - puszczę symulację dla Twojego przypadku na moim GX10, dostaniesz raport co się w niej działo, i wtedy zdecydujesz czy to ma sens. Zero ryzyka dla Twoich klientów, zero cash burn na API OpenAI.

Zobacz sam

Wideo comparative (3 minuty, split-screen playback trzech seedów):

Symulacja Qwen vs Bielik na trzech seedach. 8 minut, hostowane tymczasowo (wersja YouTube wkrótce).

Kod symulatora AIBusinessSim: repo prywatne do momentu publikacji - jeśli chcesz zobaczyć wcześniej, napisz na ratunku@chcedointernetu.pl.

Framework PROSTO (który używa Qwen w tej symulacji): Framework PROSTO - jak rozmawiać z AI

Pytania

Zrobiłbyś takie testy w swojej firmie zanim wsadzisz LLMa w produkcję? Napisz na ratunku@chcedointernetu.pl, ciekawi mnie jak inni to podchodzą. Jak wystarczy zainteresowania mogę udostępnić silnik AIBusinessSim - można go łatwo skonfigurować pod dowolną branżę (piekarnia, salon, sklep, kebab, agencja).