Machine learning a devenit cuvântul de pe orice landing page de SaaS din 2026, dar întrebat direct ce înseamnă concret, 8 din 10 antreprenori IMM dau aceeași definiție vagă: "ceva cu AI și date". Diferența între AI, machine learning și deep learning nu e o discuție academică, ci una operațională, pentru că determină ce poți și ce nu poți face cu datele tale, ce buget realist îți trebuie și ce stack tehnic alegi.
Eu lucrez de 18 ani la intersecția dintre martech și SaaS, și am văzut același tipar repetându-se: vendor vine cu "soluție AI revoluționară", IMM-ul semnează contract de 12 luni la 800 EUR/lună, iar la 6 luni descoperă că ar fi putut rezolva problema cu un model scikit-learn de 200 de linii de cod și un VPS de 15 EUR/lună. Ghidul ăsta îți arată diferențele reale, ierarhia tehnică și cazurile concrete unde ML aduce ROI într-un IMM din România, fără hype și fără să-ți vând consultanță.
Dacă încă nu ai conceptele de bază AI sub control, citește mai întâi ce este AI și ghidul pentru afaceri și pentru contextul automatizărilor n8n vs Make vs Zapier. Pentru integrarea ML cu sisteme existente, ai nevoie de baza din ce este un API explicat simplu.
AI, ML, deep learning, generative AI - ierarhia concretă
Ca să nu mai amesteci termenii, ține minte structura asta de cercuri concentrice, din cel mai larg către cel mai specific.
Artificial Intelligence (AI) este capacitatea unui sistem de a simula comportament inteligent: să raționeze, să decidă, să recunoască, să comunice. AI ca termen umbrelă acoperă tot ce nu e cod procedural clasic, de la chess engines anii 90 la ChatGPT.
Machine Learning (ML) este un subset al AI în care sistemul învață patternuri din date statistice, fără reguli hard-coded de programator. În loc să scrii "dacă X și Y atunci Z", arăți modelului 10.000 de exemple și el descoperă singur relația.
Deep Learning (DL) este un subset al ML bazat pe rețele neurale artificiale cu multe straturi (de obicei peste 3). Funcționează deosebit de bine pentru date nestructurate: imagini, audio, text, video.
Generative AI și LLM-urile (Large Language Models) sunt subseturi specializate de deep learning, antrenate să genereze conținut nou (text, imagini, cod). ChatGPT, Claude, Gemini, Midjourney, Stable Diffusion sunt toate aici.
Tabel ierarhie cu exemple concrete
| Nivel | Definiție scurtă | Exemple tipice | Stack tehnic uzual |
|---|---|---|---|
| AI clasic (symbolic) | Reguli scrise manual de expert | Expert systems medicale, Prolog, fuzzy logic termostate, chess engines pre-2017 | Lisp, Prolog, motor reguli |
| Machine Learning clasic | Învață patternuri din date tabulare | Forecasting vânzări, churn prediction, scoring credit, spam filter | scikit-learn, XGBoost, LightGBM |
| Deep Learning | Rețele neurale multistrat, date nestructurate | Recunoaștere facială, transcriere audio, traducere, OCR | TensorFlow, PyTorch, Keras |
| Generative AI / LLM | Generează conținut nou prin DL specializat | ChatGPT, Claude, Midjourney, GitHub Copilot | Hugging Face, OpenAI API, Anthropic API |
Stack real: pentru 80% din cazurile de business IMM, te oprești la rândul 2 (ML clasic). Rândul 3 și 4 vin doar când ai date nestructurate masive sau probleme specifice de NLP/computer vision.
AI clasic vs machine learning - diferența operațională
Înainte de boom-ul ML din 2012, AI însemna în principal expert systems: programatori intervievau experți domeniali (medici, juriști, mecanici auto) și codificau cunoștințele lor sub formă de reguli IF-THEN. Sistemele MYCIN (diagnostic bacterian, anii 70), DENDRAL (chimie organică) sau motoarele de diagnostic auto erau toate AI, dar zero ML.
Caracteristici AI clasic (symbolic / rule-based):
- Reguli scrise manual de experți umani
- Explicabilitate totală: poți urmări exact de ce sistemul a luat o decizie
- Funcționează cu date puține sau deloc
- Costisitor de menținut: orice schimbare cere reprogramare
- Casant: scenarii noi care nu au regulă explicită eșuează silent
- Tehnologii tipice: Prolog, CLIPS, Drools, fuzzy logic controllers
Caracteristici machine learning:
- Modelul învață singur patternuri din date
- Explicabilitate variabilă (linear regression e clară, deep learning e black box)
- Are nevoie de volum mare de date (sute pentru ML clasic, sute de mii pentru DL)
- Mentenanță prin retraining periodic, nu rescriere cod
- Robust la cazuri marginale dacă datele de antrenament le acoperă
- Tehnologii tipice: scikit-learn, XGBoost, TensorFlow, PyTorch
Când rule-based bate ML: regulamentare strictă (calcul TVA, retinere impozit), domenii cu date insuficiente, situații unde explicabilitatea legală este obligatorie. ANAF nu acceptă "modelul de ML a decis că datorezi 5.000 RON impozit". Calculul fiscal rămâne rule-based.
Când ML bate rule-based: orice problemă cu mii de variabile interconectate, patternuri pe care experții umani nu le pot articula explicit, date care evoluează în timp (comportament cumpărători, preturi market, trafic web).
Tip
Pro tip - hibridul învinge ambele extreme. Sistemele de producție mature combină reguli (pentru constrângeri rigide: TVA, GDPR, business logic explicit) cu ML (pentru predicții pe pattern complex). Un scoring credit serios are 60% rule-based (criterii ANAF, vârstă, vechime venit) și 40% ML (probabilitate default pe comportament istoric). Nu cumpăra niciodată un sistem care îți spune "pur AI". Cere arhitectura: ce e rule-based, ce e ML, cine validează deciziile la limită.
Tipurile mari de machine learning
ML clasic se împarte în trei familii mari plus două hibride. Diferența practică e în ce ai nevoie ca date de intrare.
Supervised learning - cu etichete
Ai date de intrare (features) plus etichete (labels) corecte. Modelul învață să prezică eticheta pentru date noi.
Subtipuri:
- Clasificare: eticheta e o categorie (spam / nu spam, fraud / legit, churn / retain). Algoritmi: logistic regression, decision tree, random forest, SVM, k-NN, gradient boosting.
- Regresie: eticheta e o valoare continuă (preț casă, volum vânzări lună următoare, temperatură). Algoritmi: linear regression, ridge / lasso, random forest regressor, XGBoost.
Cazuri concrete IMM RO:
- Spam filter pentru email (clasificare binară: spam / ham)
- Forecasting vânzări lunare pe baza istoric 24 luni + sezonier (regresie)
- Customer churn prediction: care clienti din abonament SaaS vor pleca luna viitoare (clasificare)
- Lead scoring: care lead-uri din CRM au probabilitate mare să cumpere (clasificare sau regresie pe scor)
- Estimare timp livrare colet pe rută (regresie)
Unsupervised learning - fără etichete
Ai doar date de intrare, fără etichete corecte. Modelul descoperă singur structuri ascunse.
Subtipuri:
- Clustering: grupează observații similare. Algoritmi: k-means, DBSCAN, hierarchical clustering. Aplicații: segmentare clienți pe comportament, grupare produse similare.
- Reducere dimensionalitate: comprimă date multivariabile păstrând informația esențială. Algoritmi: PCA (Principal Component Analysis), t-SNE, UMAP. Aplicații: vizualizare date complexe, preprocesare pentru alti algoritmi.
- Detectare anomalii: identifică observații care ies din pattern. Algoritmi: Isolation Forest, One-Class SVM, autoencoders. Aplicații: detectare fraudă plăți, detectare comportament suspect login.
- Association rules: descoperă reguli de co-ocurență (market basket analysis: cine cumpără X cumpără și Y). Algoritm: Apriori, FP-Growth.
Cazuri concrete IMM RO:
- Segmentare clienți retail în 5 grupuri comportamentale pentru campanii email diferențiate
- Detectare tranzacții suspecte într-un magazin online (sume neobișnuite, ore atipice)
- Recomandări "clienții care au cumpărat X au cumpărat și Y" pentru cross-sell
Reinforcement learning - prin recompensă
Un agent ia acțiuni într-un mediu și primește recompense sau penalități. Învață politica optimă prin trial and error.
Aplicații tipice: game playing (AlphaGo, OpenAI Five Dota), robotică (mers, manipulare obiecte), trading algoritmic, optimizare logistică (rute curieri), tuning automat campanii ads pe bidding.
Realist pentru IMM RO: rar relevant direct, costisitor și complex. Apare indirect prin produse SaaS gata făcute (ex. Google Ads Smart Bidding folosește RL în spate).
Semi-supervised și self-supervised - hibrizi
- Semi-supervised: ai puține date etichetate și multe neetichetate. Modelul folosește ambele. Folosit când labelling-ul manual e scump (medical imaging, document classification niche).
- Self-supervised: modelul își generează singur etichete din date (ex. ascunde un cuvânt din propoziție și învață să-l prezică). Este baza LLM-urilor moderne și a SimCLR pentru imagini.
Deep learning - când și de ce
Deep learning este ML cu rețele neurale care au multe straturi (de obicei 5-500). Excelentă la date nestructurate (imagini, audio, text, video), dar masiv overkill pentru majoritatea problemelor business.
Arhitecturile principale
- CNN (Convolutional Neural Networks): standard pentru imagini. Aplicații: clasificare obiecte, OCR, recunoaștere facială, segmentare medicală. Modele iconice: ResNet, EfficientNet, YOLO.
- RNN și LSTM (Recurrent Neural Networks, Long Short-Term Memory): secvențe temporale. Aplicații istorice: traducere, transcriere audio, forecasting time-series. Au fost în mare parte înlocuite de Transformer-e după 2018.
- Transformer: arhitectura care a schimbat NLP-ul în 2017 (paper "Attention is All You Need"). Baza pentru BERT, GPT, Claude, Gemini, LLaMA. Excelent la text, dar și la imagini (Vision Transformers) sau audio (Whisper).
- Diffusion models: generare imagini. Stable Diffusion, DALL-E 3, Midjourney rulează pe variante de diffusion.
- GAN (Generative Adversarial Networks): două rețele care concurează, generator vs discriminator. Folosite pentru deepfake-uri, generare imagini sintetice. Mai puțin la modă din 2023.
Când deep learning bate ML clasic
- Volum mare de date nestructurate (peste 10.000 imagini, peste 100.000 documente text)
- Probleme unde feature engineering manual e impractic (vision, speech, NLP complex)
- Buget GPU disponibil (training pe GPU, nu CPU)
- Toleranță la black box (greu de explicat de ce un model DL a decis ceva)
Când ML clasic bate deep learning
- Date tabulare (rânduri și coloane în Excel sau bază de date)
- Volum mic-mediu de date (sub 100.000 exemple)
- Cerință de explicabilitate (clienti, auditori, regulatori)
- Buget limitat (training pe CPU în câteva minute vs ore pe GPU)
Warning
Anti-pattern frecvent în IMM-uri RO: vendor vine cu "deep learning enterprise platform" pentru date tabulare cu 5.000 de rânduri. Pe astfel de date, random forest sau XGBoost antrenate în 30 secunde pe laptop bat orice rețea neurală și sunt explicabile. Cere benchmarks reale pe datele tale, nu demo-uri pe ImageNet. Dacă vendor-ul refuză să arate comparație XGBoost vs modelul lor proprietar, e semnal puternic că modelul lor nu adaugă valoare reală.
Workflow ML end-to-end - cum arată un proiect real
Un proiect ML serios are 8-10 etape. Mulți vendor-i vând doar "modelul", dar 70-80% din effort e înainte și după.
1. Data collection: agregare date din surse (DB tranzacțional, CRM, Google Analytics, ERP, export Excel). Pentru un IMM RO tipic, primul blocker e că datele sunt în 5 silos diferite care nu vorbesc între ele.
2. Data cleaning și exploration: tratezi valori lipsă, outliers, duplicate, format-uri inconsistente (date scrise în 3 formate diferite, nume județe cu și fără diacritice). Estimează 40-60% din timpul total al proiectului aici. Tool-uri: pandas (Python), R, OpenRefine.
3. Feature engineering: transformi date brute în features utile pentru model. Exemple: extragi "ziua săptămânii" și "luna" din timestamp, calculezi "media cumpărături ultimele 30 zile" per client, encode categorical variables (one-hot, target encoding).
4. Train / test split: împarți datele în set de antrenament (70-80%), validare (10-15%) și test (10-15%). Pentru date temporale, splitezi cronologic, nu aleatoriu (altfel ai data leakage).
5. Model training: antrenezi unul sau mai multe algoritmi candidate. Pentru date tabulare, încearcă întâi linear regression / logistic regression (baseline), apoi random forest, apoi XGBoost / LightGBM. Doar dacă acestea nu sunt suficiente, treci la deep learning.
6. Evaluation: măsori performanță pe set de test (date pe care modelul nu le-a văzut). Metrici depind de problemă:
- Clasificare: accuracy, precision, recall, F1-score, ROC-AUC, confusion matrix
- Regresie: RMSE (Root Mean Square Error), MAE (Mean Absolute Error), MAPE (procentual), R-squared
- NLP: BLEU, ROUGE pentru generare; F1 pentru NER, intent classification
- Ranking / recomandare: NDCG, MAP, Hit Rate at K
7. Hyperparameter tuning: optimizezi parametrii modelului (depth-ul unui tree, learning rate, regularization). Tool-uri: GridSearchCV, RandomizedSearchCV, Optuna, Ray Tune.
8. Deployment: pui modelul în producție. Variante: REST API (FastAPI, Flask), batch scoring (cron + script), streaming (Kafka + model server), edge (telefon, IoT).
9. Monitoring: urmărești performanță în producție - latență, throughput, accuracy pe date noi, data drift (distribuția datelor noi diferă de cele de antrenament).
10. Retraining: periodic (lunar, săptămânal) reantrenezi modelul pe date proaspete. Frecvența depinde de viteza de schimbare a domeniului.
MLOps - versionare și reproducibilitate
Cele trei lucruri pe care le versionezi obligatoriu:
- Data: ce date au fost folosite la antrenament (DVC, Git LFS, Delta Lake)
- Model: artefactul antrenat plus hyperparameters (MLflow, Weights and Biases, Neptune)
- Cod: scripturi de preprocesare, training, inference (Git standard)
Pentru un IMM care începe, MLflow open-source pe un VPS de 15 EUR/lună acoperă 90% din nevoi. AutoML platforms (Google Vertex AI, AWS SageMaker Canvas, Azure ML) abstractizează pipeline-ul dar cu lock-in pe cloud.
Cazuri concrete IMM România - unde aduce ROI real
Stack real pentru un IMM 10-50 angajați care vrea să introducă ML. Selecție pe criteriul ROI clar în primele 6 luni.
Forecasting vânzări
Problemă: anticipezi vânzările lună următoare per categorie / SKU pentru planning stoc și cash flow.
Approach: regresie pe istoric 18-24 luni, features incluzând trend, sezonier, promoții, calendar evenimente.
Algoritmi: Prophet (Facebook, foarte ușor de start), SARIMA, XGBoost cu lag features, LightGBM. Pentru cazuri complexe cu multe SKU-uri, DeepAR sau N-BEATS.
ROI tipic: 10-20% reducere stoc imobilizat, 5-10% reducere stockout-uri. Pentru un retailer cu 2M EUR cifră de afaceri, asta înseamnă 100-300k EUR în cash flow eliberat.
Customer churn prediction
Problemă: identifici clienti SaaS / abonament cu probabilitate mare să nu reînnoiască în următoarele 30-60 zile.
Approach: clasificare binară pe features comportamentale (login frequency, feature usage, support tickets, payment delays).
Algoritmi: logistic regression baseline, random forest, XGBoost. Pentru evenimente rare (sub 5% churn), tehnici de balansare (SMOTE) sau metrici dedicate (PR-AUC).
ROI tipic: campanie de retenție pe top 20% probabilitate churn recuperează 30-50% din clienti la risc. Pentru un SaaS RO cu 500 abonati la 50 EUR/lună și 8% churn anual, salvarea a 10-15 clienti înseamnă 6-9k EUR / an recuperați.
Recomandare produse - collaborative filtering
Problemă: pe pagina produs, afișezi cross-sell relevant care convertește.
Approach: matrix factorization (SVD), item-based collaborative filtering, sau hybrid content + collaborative.
Algoritmi: scikit-surprise, implicit, LightFM. Pentru e-commerce, Amazon Personalize sau Algolia Recommend (managed).
ROI tipic: 5-15% creștere average order value. Pentru un magazin cu 100k EUR / lună vânzări, asta înseamnă 5-15k EUR / lună extra.
OCR facturi PDF - automatizare contabilitate
Problemă: 200 de facturi PDF / lună intrate pe email, contabilul le scrie manual în Saga sau Smartbill.
Approach: computer vision + NLP pentru extracție câmpuri (CUI furnizor, sumă, TVA, dată, număr factură).
Stack: API gata făcute (Google Document AI, AWS Textract, Microsoft Form Recognizer) - tipic 0,01-0,05 EUR per pagină. Pentru volum mare, modele open-source (LayoutLM, Donut) self-hosted.
ROI tipic: economisești 20-40 ore / lună de muncă manuală. Pentru un IMM cu volum facturi mediu, 600-1.200 EUR / lună salvate la cost API < 50 EUR / lună.
Detectare fraudă plăți
Problemă: pe un magazin online, identifici tranzacții cu probabilitate mare de chargeback înainte să procesezi plata.
Approach: clasificare binară pe features tranzacție (IP, device, country mismatch, velocity), plus detectare anomalii (Isolation Forest) pentru cazuri unseen.
Algoritmi: XGBoost pe features tabulare + Isolation Forest pentru anomaly score. Pentru volum mic, soluții managed (Stripe Radar, Adyen Risk).
ROI tipic: reducere chargeback rate de la 1-2% la 0,2-0,5%. Pentru un magazin care procesează 500k EUR / lună plăți, asta înseamnă 2.500-7.500 EUR / lună evitate la disputes.
Spam filter custom pe email business
Problemă: filtrul Gmail standard scapă cold outreach agresiv și newsletter-e dubioase care intră în Inbox.
Approach: clasificare binară pe text features (TF-IDF, embeddings) + metadata (sender, headers).
Algoritmi: Naive Bayes baseline, logistic regression cu TF-IDF, sau distilBERT fine-tuned pentru cazuri complexe.
ROI tipic: economisești 30-60 min / zi pe persoană din triaj manual inbox.
Tabel resumat tipuri ML și cazuri IMM
| Tip ML | Caz IMM RO | Algoritm tipic | Volum date minim | Time-to-value |
|---|---|---|---|---|
| Supervised - regresie | Forecasting vânzări | Prophet, XGBoost | 18+ luni istoric | 2-4 săptămâni |
| Supervised - clasificare | Customer churn | Logistic regression, XGBoost | 500+ clienti, 12+ luni | 3-6 săptămâni |
| Supervised - clasificare | Spam filter custom | Naive Bayes, distilBERT | 1.000+ emails etichetate | 1-2 săptămâni |
| Unsupervised - clustering | Segmentare clienti | k-means, DBSCAN | 500+ clienti | 1-3 săptămâni |
| Unsupervised - anomaly | Detectare fraudă | Isolation Forest | 10.000+ tranzacții | 2-4 săptămâni |
| Collaborative filtering | Recomandare produse | SVD, LightFM | 1.000+ interacțiuni | 2-4 săptămâni |
| Computer vision | OCR facturi | LayoutLM, API Document AI | imediat (API) | 1-2 săptămâni |
Stack tehnic realist pentru un IMM RO
Setup în 30 min pentru un proof-of-concept pe date tabulare: Python 3.11 + Jupyter Notebook + pandas + scikit-learn + matplotlib. Costă 0 EUR, rulează pe orice laptop decent.
Tools de bază (gratis)
- Python + pandas + scikit-learn: standard absolut pentru ML clasic. Curve de învățare 2-4 săptămâni pentru cineva tehnic.
- Jupyter Notebook / JupyterLab: mediu interactiv pentru exploration și prototip.
- XGBoost / LightGBM: gradient boosting, win-uri constant la kaggle competitions pe date tabulare.
- Hugging Face Transformers: librărie pentru modele pre-antrenate NLP (BERT, GPT-2, multi-lingual). Permite fine-tuning pe date proprii.
- MLflow: experiment tracking și model registry. Self-hosted pe VPS, 0 EUR.
Tools paid relevante
- OpenAI API / Anthropic API: acces la GPT-4 / Claude pentru NLP avansat fără să antrenezi singur (~0,01-0,05 EUR per 1k tokens).
- Google Vertex AI / AWS SageMaker / Azure ML: platforme managed pentru training + deployment. Pornesc de la 50-200 EUR / lună pentru workload moderat, scaling rapid.
- Hugging Face Inference Endpoints: deployment ușor pentru modele open-source (~50-500 EUR / lună depinzând de GPU).
- DataRobot, H2O.ai Driverless: AutoML enterprise (5.000-50.000 EUR / an), util doar peste un anumit prag de complexitate.
AutoML pentru IMM fără data scientist in-house
- Google Vertex AI AutoML: drag-drop, antrenează model pe CSV-uri sau imagini. 200-2.000 EUR / proiect.
- AWS SageMaker Canvas: similar, integrare bună cu S3.
- Azure ML Studio: visual interface pentru pipeline-uri ML.
- DataRobot, h2o.ai AutoML: enterprise, scump dar puternic.
Realist pentru un IMM care începe: petrece 2-3 luni cu scikit-learn pe propriile date înainte să cumperi platformă managed. 80% din value vine din date curate și înțelegerea problemei, nu din algoritmul folosit.
Limitele și capcanele machine learning
ML nu e magie. Următoarele probleme te vor lovi sigur dacă nu le anticipezi.
Volum insuficient de date: ML clasic vrea minim 500-1.000 exemple per clasă, deep learning vrea zeci de mii. Dacă ai 50 de clienti istorici, nu poți antrena nimic util.
Bias din date proaste: modelul învață ce e în date, inclusiv bias-urile istorice. Un model de scoring credit antrenat pe date care discriminau implicit o categorie va perpetua discriminarea. Audit explicit înainte de deployment.
Data drift în producție: distribuția datelor noi diferă de cele de antrenament (clienti se schimbă, preturi se schimbă, comportament se schimbă). Modelul își pierde accuracy în timp. Soluție: monitoring + retraining periodic.
Concept drift: nu doar datele, ci relațiile între features și target se schimbă. Un model de churn antrenat pre-COVID poate fi complet irelevant post-COVID.
Explicability black box: deep learning și ensemble-uri complexe sunt greu de explicat la nivel de decizie individuală. Pentru cazuri reglementate (GDPR Article 22, credit scoring, recrutare), folosește modele simple (linear, decision tree) sau tehnici de explanation (SHAP, LIME).
Cost ascuns de labelling: pentru supervised learning ai nevoie de date etichetate. Etichetarea manuală costă 0,5-5 EUR per item pentru cazuri simple, 10-50 EUR pentru cazuri specializate (medical, legal). Bugetul de labelling depășește frecvent costul de compute.
Training cost real pentru deep learning: antrenarea unui Vision Transformer de zero pe ImageNet costă 5.000-50.000 USD în GPU time. Pentru LLM-uri mari, milioane. Pentru un IMM, regula e: niciodată să antrenezi de zero, întotdeauna fine-tunezi un model pre-antrenat sau folosești API.
Hype vs realitate: 60-70% din proiectele ML enterprise eșuează (Gartner 2024). Cauzele tipice: business case prost, date insuficiente, lipsă de infrastructure, lipsă de buy-in operațional. Începe cu probleme mici, măsurabile, cu ROI clar în 3 luni.
Tip
Pro tip - heuristic înaintea ML-ului. Pentru orice problemă pe care vrei să o ataci cu ML, scrie întâi soluția "stupid baseline" cu reguli simple (if-then) și măsoară performanță. De multe ori, regula "predictie = media ultimelor 3 luni" pentru forecasting bate primele 3 iterații de ML și costă 0 EUR. Treci la ML doar când baseline-ul devine clar insuficient. Asta te scutește de 50% din proiecte care nu trebuiau să existe.
Cum începi practic în următoarele 30 zile
Pentru un IMM care vrea să testeze ML fără investiție majoră:
Săptămâna 1: identifică o problemă concretă cu date existente. Criterii: ai minim 500 exemple, problema are valoare economică clară (timp economisit sau revenue suplimentar măsurabil), output-ul modelului poate fi integrat într-un workflow existent.
Săptămâna 2: agregă datele într-un singur CSV. Curăță inconsistențe, tratează valori lipsă. Estimează că aici pleacă 50% din timpul total.
Săptămâna 3: deschide un Google Colab (gratis, are GPU disponibil) sau un Jupyter local. Antrenează 3 baseline-uri: predictie media, logistic / linear regression, random forest. Măsoară performanță pe set de test.
Săptămâna 4: dacă baseline-ul e promițător, iterează. Feature engineering nou, alți algoritmi, tuning. Dacă nu e promițător, oprește proiectul și caută altul. Aici e momentul disciplinei: 30% din PoC-uri eșuează la stadiul ăsta și e OK.
Pentru team size-ul tău, recomandare: dacă ai sub 20 angajați, externalizează primul proiect ML la un freelancer senior (300-500 EUR / zi) sau o agenție mică (5.000-15.000 EUR / PoC). Internalizezi după ce ai 2-3 proiecte care funcționează în producție. Hiring direct senior ML engineer la 5.000-8.000 EUR / lună fără pipeline de probleme clar definite este capcană sigură.
Întrebări frecvente
Care e diferența scurtă între AI, ML și deep learning?
AI este termenul umbrelă pentru orice sistem care simulează inteligență. ML este un subset al AI care învață din date statistice fără reguli hard-coded. Deep learning este un subset al ML bazat pe rețele neurale cu multe straturi. Generative AI și LLM-urile sunt subseturi specializate de deep learning. Ierarhia: AI conține ML, care conține DL, care conține GenAI.
Am nevoie de data scientist ca să introduc ML în firmă?
Nu obligatoriu pentru prima fază. Pentru proiecte tipice IMM (forecasting, churn, OCR), un dev backend cu 2-3 luni de formare scikit-learn + Python plus consultanță externă pe arhitectură rezolvă majoritatea cazurilor. Hiring data scientist senior (5.000-8.000 EUR / lună) merită doar când ai 2-3 modele în producție și pipeline clar de probleme noi.
Cât de mari trebuie să fie datele pentru un proiect ML?
Pentru ML clasic pe date tabulare: minim 500-1.000 exemple per clasă (clasificare) sau per perioadă temporală relevantă (regresie). Pentru deep learning: minim 10.000 imagini etichetate, peste 100.000 documente text. Sub praguri, fie folosești tehnici de data augmentation, transfer learning, sau renunti la ML pentru abordare rule-based.
Care e diferența între machine learning și statistics?
Statistici clasice se concentrează pe inferență (înțelegerea relațiilor între variabile, intervale de încredere, testare ipoteze). ML se concentrează pe predicție (output corect pe date noi). Multe tehnici se suprapun (linear regression, logistic regression), dar mindset-ul diferă: statisticianul vrea să înțeleagă "de ce", ML engineer-ul vrea să prezică "ce". În producție, ML acceptă black box dacă predicțiile sunt corecte.
Ce limbaj de programare folosesc pentru ML?
Python este standardul absolut (80%+ din proiecte). Ecosistem matur: pandas, scikit-learn, TensorFlow, PyTorch, Hugging Face. R rămâne folosit în statistici academice și healthcare. Pentru deployment de înaltă performanță, modelele antrenate în Python se rulează frecvent în Go, Rust sau C++ pentru inference latency mică. Julia câștigă teren în calcul științific, dar nu pentru ML business.
Pot folosi ML fără cloud (on-premise)?
Da. ML clasic rulează perfect pe un server local sau VPS de 20-50 EUR / lună. Deep learning necesită GPU - poti folosi un server local cu RTX 4090 sau similar (1.500-2.500 EUR investiție unică) sau cloud GPU on-demand (Lambda Labs, RunPod, 0,30-2 USD / oră). Pentru LLM-uri mari self-hosted, vezi Ollama sau LM Studio pe stații cu 32+ GB RAM.
Cum măsor ROI-ul unui proiect ML?
Definește metricul business înainte de start, nu după. Exemple: pentru churn prediction, valoarea recuperată = (clienti salvati prin retenție) × (LTV mediu). Pentru forecasting, valoarea = (reducere stock imobilizat în EUR) + (reducere stockout × marja pierdută). Compari valoarea cu costul total: development + infrastructure + mentenanță + retraining. Proiect viabil = ROI peste 3x în 12 luni.
Cât de des trebuie reantrenat un model?
Depinde de viteza de schimbare a domeniului. Spam filter: lunar (spammers schimbă tactici constant). Forecasting vânzări retail: lunar sau quarterly. Image classification pentru produse: anual (după lansare colecție nouă). Setup monitoring cu praguri (ex. accuracy drop sub 90% din baseline declanșează retraining automat). Mai bine monitoring inteligent decât cron rigid.
ChatGPT și Claude sunt machine learning?
Da, sunt LLM-uri (Large Language Models), un tip specializat de deep learning. Folosesc arhitectura Transformer, antrenate pe corpusuri masive de text (terabytes) cu metoda self-supervised (next token prediction) plus reinforcement learning from human feedback (RLHF). Tehnic, sunt vârful piramidei: AI conține ML conține DL conține LLM. Pentru un IMM, folosești prin API (OpenAI, Anthropic) nu antrenezi singur.
Concluzie
Machine learning nu e o tehnologie singulară, ci o familie largă de algoritmi care învață din date. Diferența cu AI clasic e fundamentală operațional: ML scalează cu datele, AI clasic scalează cu munca expertului uman. Diferența cu deep learning e de scop: DL excelează la date nestructurate masive, ML clasic câștigă pe date tabulare medii cu costuri 10x mai mici.
Pentru un IMM din România, ROI-ul real vine din 5-7 cazuri concrete: forecasting vânzări, churn prediction, OCR facturi, detectare fraudă, recomandare produse, segmentare clienti, spam filter. Stack-ul de intrare costă 0 EUR (Python + scikit-learn pe laptop), iar primul proiect serios poate fi gata în 4-6 săptămâni dacă ai date curate.
Practic, asta înseamnă o decizie clară: începe cu o problemă mică și măsurabilă, baseline rule-based, apoi ML clasic, apoi deep learning doar dacă ai un caz solid. Evită capcana "deep learning enterprise platform" la primul proiect și capcana hiring senior data scientist înainte să ai pipeline de probleme. ML e instrument, nu strategie. Strategia rămâne cum economisești ore de muncă manuală și cum descoperi vânzări pe care altfel le-ai pierde.
Surse
- scikit-learn.org/stable/
- pytorch.org/docs
- tensorflow.org/learn
- huggingface.co/docs/transformers
- mlflow.org/docs/latest
- cloud.google.com/vertex-ai/docs
- aws.amazon.com/sagemaker
- gartner.com - AI Maturity Reports 2024
- arxiv.org - paper "Attention is All You Need" (Vaswani et al. 2017)