होम › सभी पाठ › प्रो धारा — बिल्डर व इंजीनियर
📊 डेटा स्किल्स: AI जॉब्स की असली नींव
Spreadsheet से SQL और Python तक — data की सीढ़ी, पूरी तरह free
इंजीनियरिंग/टेक की राह पर
AI का 80% काम glamour नहीं, data है
2026 में AI engineer, data analyst, ML engineer — हर role की नींव एक ही है: data को समझना, साफ़ करना और organize करना। Model train करना glamorous लगता है, लेकिन industry का सच यह है कि एक data professional का लगभग 80% समय data cleaning और preparation में जाता है, सिर्फ़ 20% analysis या modeling में। इसलिए जो इंसान data संभालना जानता है, वो हर AI team के लिए कीमती है — चाहे उसने शुरुआत गाँव की दुकान के हिसाब-किताब से ही क्यों न की हो।
सीढ़ी 1: Spreadsheet mastery — शुरुआत यहीं से
Spreadsheet आपका पहला data tool है, और phone पर भी free apps में चलता है। बुनियादी सोच पकड़ो: हर row = एक record (जैसे एक दिन की बिक्री), हर column = एक field (जैसे Date, Item, Amount)। यही rows-columns वाली सोच आगे SQL की tables और Python के DataFrames में ज्यों-की-त्यों काम आएगी।
- SUM, AVERAGE, COUNT — जोड़, औसत, गिनती: हिसाब की रीढ़
- FILTER और SORT — हज़ार rows में से सिर्फ़ वही देखना जो चाहिए
- IF — शर्त लगाना: जैसे Amount 500 से ऊपर हो तो 'बड़ी बिक्री' लिखो
- VLOOKUP/XLOOKUP — एक table से दूसरी table में value ढूँढ कर लाना
- Pivot Table — एक क्लिक में summary: किस item की कितनी total बिक्री
- Chart बनाना — data को आँखों से दिखाना, सिर्फ़ numbers नहीं
सीढ़ी 2: SQL — data से सवाल पूछने की भाषा
Database को एक बहुत बड़ी spreadsheet समझो — इतनी बड़ी कि करोड़ों rows हों। SQL वो भाषा है जिसमें आप data से लगभग English जैसे sentence में सवाल पूछते हो। Example: SELECT fasal, SUM(bikri) FROM mandi_data GROUP BY fasal; — मतलब: mandi_data table में से हर fasal की total bikri निकाल दो। GROUP BY हर फसल के हिसाब से rows को group करता है, SUM हर group की बिक्री जोड़ देता है। जहाँ spreadsheet कुछ लाख rows पर हाँफने लगती है, वहाँ SQL करोड़ों rows पर आराम से चलती है — इसीलिए हर data job की listing में SQL लिखा होता है।
सीढ़ी 3: Python — automation की ताकत
Python में pandas library वही spreadsheet वाला काम code से करती है — लेकिन repeat होने वाला काम एक बार लिखो, हज़ार बार चलाओ। छोटा real snippet: import pandas as pd | df = pd.read_csv("dukaan.csv") | df["item"] = df["item"].str.strip().str.lower() | print(df.groupby("item")["amount"].sum()) — चार lines में file पढ़ी, item के नाम साफ़ किए (फालतू space हटाया, lowercase किया), और हर item की total बिक्री निकाल दी। यही काम हाथ से घंटों लेता।
Data cleaning ही असली 80% क्यों है
- एक ही चीज़ की तीन spellings: 'आलू', 'aloo', 'Alu ' — इंसान के लिए एक, machine के लिए तीन अलग चीज़ें
- Missing values — किसी दिन की entry ही नहीं भरी
- Units का घालमेल — कहीं kg, कहीं quintal, कहीं सिर्फ़ 'बोरी'
- Duplicate rows — एक ही बिक्री दो बार entry हो गई
- Date के अलग-अलग format — 05/08/2026, 5 Aug, परसों
- गंदे data पर बना कोई भी analysis या AI model गलत जवाब देगा — garbage in, garbage out
Mini-exercise: अपने गाँव/दुकान का data (पहला project)
- अपने आस-पास का एक data source चुनो — दुकान की रोज़ की बिक्री, doodh collection, खेत का खर्चा, या घर का हिसाब
- Spreadsheet में columns बनाओ: Date, Item, Quantity, Unit, Amount
- 7 दिन तक रोज़ entries भरो — जैसा है वैसा लिखो, गलतियाँ भी आने दो (यही असली data है)
- हफ्ते बाद cleaning करो: spellings एक जैसी, units same, missing values ठीक — यही 80% वाला असली काम है
- अब data से सवाल पूछो: सबसे ज़्यादा क्या बिका? किस दिन सबसे कम? SUM और Pivot Table से जवाब निकालो
- इस पूरी process का screenshot और 3-line summary सँभाल कर रखो — यही आपका पहला portfolio project है, interview में बताने लायक
इस पाठ को इंटरैक्टिव तरीके से सीखिए
अभ्यास, क्विज़, सुनने की सुविधा और आपके नाम का प्रमाणपत्र — सब मुफ़्त, बिना इंटरनेट भी चलता है।
इसे आज़माएँ — तैयार प्रॉम्प्ट
यह प्रॉम्प्ट कॉपी करके किसी भी AI ऐप में पूछिए:
अपनी समझ जाँचिए
एक data professional का सबसे ज़्यादा समय (लगभग 80%) आमतौर पर किस काम में जाता है?
- नए AI models train करने में
- data cleaning और preparation में
- presentations बनाने में
- नई programming languages सीखने में
सही उत्तर: data cleaning और preparation में
Real-world data गंदा होता है — अलग spellings, missing values, units का घालमेल। इसे साफ़ किए बिना कोई analysis या model सही नहीं चलता, इसलिए cleaning ही सबसे बड़ा (और सबसे कीमती) काम है।
SELECT fasal, SUM(bikri) FROM mandi_data GROUP BY fasal; — यह SQL query क्या करेगी?
- table की सारी rows delete कर देगी
- हर फसल की total बिक्री निकालेगी
- सिर्फ़ पहली row दिखाएगी
- data को Python में बदल देगी
सही उत्तर: हर फसल की total बिक्री निकालेगी
GROUP BY हर fasal के हिसाब से rows को group करता है और SUM(bikri) हर group की बिक्री जोड़ देता है — यानी हर फसल की total बिक्री एक ही query में मिल जाती है।
इसी विषय के और पाठ
- Prompt Engineering: प्रो-स्तर की कलाAI से हर बार exactly वही output लेना — system prompt से JSON तक
- बिना Coding के AI AutomationForm→Sheet→AI→WhatsApp — बिना code लिखे असली काम automate करो
- AI API से अपना पहला प्रोजेक्टAPI की घंटी बजाना सीखिए — key की सुरक्षा से लेकर पहले demo तक
- ओपन-सोर्स AI: बराबरी का मैदानOpen-weight models, local चलाना और GitHub से global पहचान
- ज़िम्मेदार AI Builder बनोBias, privacy, testing, hallucination — भरोसेमंद AI बनाना सीखो