AI शिक्षा केंद्रराष्ट्रीय परिवर्तन दल मुफ़्त सीखना शुरू करें →

होम › सभी पाठ › प्रो धारा — बिल्डर व इंजीनियर

📊 डेटा स्किल्स: AI जॉब्स की असली नींव

Spreadsheet से SQL और Python तक — data की सीढ़ी, पूरी तरह free

इंजीनियरिंग/टेक की राह पर

AI का 80% काम glamour नहीं, data है

2026 में AI engineer, data analyst, ML engineer — हर role की नींव एक ही है: data को समझना, साफ़ करना और organize करना। Model train करना glamorous लगता है, लेकिन industry का सच यह है कि एक data professional का लगभग 80% समय data cleaning और preparation में जाता है, सिर्फ़ 20% analysis या modeling में। इसलिए जो इंसान data संभालना जानता है, वो हर AI team के लिए कीमती है — चाहे उसने शुरुआत गाँव की दुकान के हिसाब-किताब से ही क्यों न की हो।

सीढ़ी 1: Spreadsheet mastery — शुरुआत यहीं से

Spreadsheet आपका पहला data tool है, और phone पर भी free apps में चलता है। बुनियादी सोच पकड़ो: हर row = एक record (जैसे एक दिन की बिक्री), हर column = एक field (जैसे Date, Item, Amount)। यही rows-columns वाली सोच आगे SQL की tables और Python के DataFrames में ज्यों-की-त्यों काम आएगी।

सीढ़ी 2: SQL — data से सवाल पूछने की भाषा

Database को एक बहुत बड़ी spreadsheet समझो — इतनी बड़ी कि करोड़ों rows हों। SQL वो भाषा है जिसमें आप data से लगभग English जैसे sentence में सवाल पूछते हो। Example: SELECT fasal, SUM(bikri) FROM mandi_data GROUP BY fasal; — मतलब: mandi_data table में से हर fasal की total bikri निकाल दो। GROUP BY हर फसल के हिसाब से rows को group करता है, SUM हर group की बिक्री जोड़ देता है। जहाँ spreadsheet कुछ लाख rows पर हाँफने लगती है, वहाँ SQL करोड़ों rows पर आराम से चलती है — इसीलिए हर data job की listing में SQL लिखा होता है।

सीढ़ी 3: Python — automation की ताकत

Python में pandas library वही spreadsheet वाला काम code से करती है — लेकिन repeat होने वाला काम एक बार लिखो, हज़ार बार चलाओ। छोटा real snippet: import pandas as pd | df = pd.read_csv("dukaan.csv") | df["item"] = df["item"].str.strip().str.lower() | print(df.groupby("item")["amount"].sum()) — चार lines में file पढ़ी, item के नाम साफ़ किए (फालतू space हटाया, lowercase किया), और हर item की total बिक्री निकाल दी। यही काम हाथ से घंटों लेता।

Data cleaning ही असली 80% क्यों है

Mini-exercise: अपने गाँव/दुकान का data (पहला project)

  1. अपने आस-पास का एक data source चुनो — दुकान की रोज़ की बिक्री, doodh collection, खेत का खर्चा, या घर का हिसाब
  2. Spreadsheet में columns बनाओ: Date, Item, Quantity, Unit, Amount
  3. 7 दिन तक रोज़ entries भरो — जैसा है वैसा लिखो, गलतियाँ भी आने दो (यही असली data है)
  4. हफ्ते बाद cleaning करो: spellings एक जैसी, units same, missing values ठीक — यही 80% वाला असली काम है
  5. अब data से सवाल पूछो: सबसे ज़्यादा क्या बिका? किस दिन सबसे कम? SUM और Pivot Table से जवाब निकालो
  6. इस पूरी process का screenshot और 3-line summary सँभाल कर रखो — यही आपका पहला portfolio project है, interview में बताने लायक
Free रास्ते: spreadsheet apps phone पर free हैं; SQL browser में ही free interactive tutorial sites पर practice हो जाती है (install कुछ नहीं); Python के लिए free online compilers और phone apps काफ़ी हैं। ईमानदार बात — data skills से analyst/operations jobs का रास्ता खुलता है, income संभव है, गारंटी नहीं। फ़र्क़ रोज़ की practice से पड़ता है। और AI चैटबॉट आपका helper है, replacement नहीं — cleaning का logic आपको खुद समझना होगा, वरना AI की गलती भी पकड़ नहीं पाओगे।
❝ मेरी दुकान का data spreadsheet में है — columns: Date, Item, Quantity, Amount। Item column में एक ही चीज़ की अलग-अलग spellings हैं (जैसे 'aloo', 'Aloo ', 'आलू')। मुझे step-by-step बताओ कि इन्हें एक जैसा कैसे करूँ — TRIM, LOWER और find-replace जैसे तरीकों के साथ, आसान हिंदी में। ❞→ AI आपको cleaning का पूरा तरीका देगा — कौन सा formula कहाँ लगाना है, किस order में, और कैसे check करें कि सब spellings एक हो गईं❝ मुझे SQL के SELECT, WHERE और GROUP BY एक किसान की मंडी बिक्री वाली table के example से समझाओ — पहले concept आसान हिंदी में, फिर query, फिर हर line का मतलब। आख़िर में 3 practice सवाल भी दो। ❞→ AI mandi वाली familiar example पर तीनों concepts समझाएगा, queries लिखकर हर हिस्से का मतलब बताएगा, और practice सवालों से आपकी समझ check होगी

इस पाठ को इंटरैक्टिव तरीके से सीखिए

अभ्यास, क्विज़, सुनने की सुविधा और आपके नाम का प्रमाणपत्र — सब मुफ़्त, बिना इंटरनेट भी चलता है।

यह पाठ खोलें →

इसे आज़माएँ — तैयार प्रॉम्प्ट

यह प्रॉम्प्ट कॉपी करके किसी भी AI ऐप में पूछिए:

तुम मेरे data-skills coach हो। मैं phone से सीख रहा/रही हूँ और beginner हूँ। मेरे लिए 15 दिन का plan बनाओ: पहले 5 दिन spreadsheet (SUM, AVERAGE, FILTER, Pivot Table), अगले 5 दिन SQL basics (SELECT, WHERE, GROUP BY), आख़िरी 5 दिन Python pandas की शुरुआत। हर दिन के लिए दो: 1 concept आसान हिंदी में, 1 छोटा practice task जो मैं अपनी दुकान/खेत के असली data पर करूँ, और 1 सवाल जिससे मैं खुद को check करूँ। सिर्फ़ free resources suggest करना।

अपनी समझ जाँचिए

एक data professional का सबसे ज़्यादा समय (लगभग 80%) आमतौर पर किस काम में जाता है?

  • नए AI models train करने में
  • data cleaning और preparation में
  • presentations बनाने में
  • नई programming languages सीखने में

सही उत्तर: data cleaning और preparation में

Real-world data गंदा होता है — अलग spellings, missing values, units का घालमेल। इसे साफ़ किए बिना कोई analysis या model सही नहीं चलता, इसलिए cleaning ही सबसे बड़ा (और सबसे कीमती) काम है।

SELECT fasal, SUM(bikri) FROM mandi_data GROUP BY fasal; — यह SQL query क्या करेगी?

  • table की सारी rows delete कर देगी
  • हर फसल की total बिक्री निकालेगी
  • सिर्फ़ पहली row दिखाएगी
  • data को Python में बदल देगी

सही उत्तर: हर फसल की total बिक्री निकालेगी

GROUP BY हर fasal के हिसाब से rows को group करता है और SUM(bikri) हर group की बिक्री जोड़ देता है — यानी हर फसल की total बिक्री एक ही query में मिल जाती है।

इसी विषय के और पाठ