ಹುಡುಕು ಹೇಗೆ ತರುತ್ತದೆ
ಕರಡು, 2026-10-11. ಈ ಕನ್ನಡ ಪಠ್ಯವನ್ನು ಇನ್ನೂ ಕನ್ನಡಿಗ ಓದುಗರೊಬ್ಬರು ಮತ್ತು ವಕೀಲರು ಓದಿಲ್ಲ. ಇದು ಇಂಗ್ಲಿಷ್ ಪುಟದ ಅನುವಾದ; ಎರಡರಲ್ಲಿ ವ್ಯತ್ಯಾಸ ಕಂಡರೆ ಇಂಗ್ಲಿಷ್ ಪುಟವೇ ಸರಿ.
How Huduku fetches, in English
ಹುಡುಕು ಒಂದು ಸ್ವತಂತ್ರ ಮಾಧ್ಯಮ-ಸಾಕ್ಷರತಾ ಯೋಜನೆ. ಆಯ್ದ ಮಾಧ್ಯಮಗಳ ಮುಖ್ಯಾಂಶಗಳನ್ನು, ಪ್ರತಿಯೊಂದಕ್ಕೂ ಪ್ರಕಾಶಕರ ಪುಟದ ಕೊಂಡಿಯೊಂದಿಗೆ, ಅದು ತೋರಿಸುತ್ತದೆ. ಅದರ ತರುವ ಯಂತ್ರ HudukuBot ಪ್ರಕಾಶಕರಿಂದ ಏನನ್ನು ಕೇಳುತ್ತದೆ, ಎಷ್ಟು ಬಾರಿ, ಮತ್ತು ಅದನ್ನು ನಿಲ್ಲಿಸುವುದು ಹೇಗೆ ಎಂಬುದನ್ನು ಈ ಪುಟ ಹೇಳುತ್ತದೆ.
ಯಾರು ಕೇಳುತ್ತಾರೆ
ಪ್ರಕಾಶಕರ ತಾಣಕ್ಕೆ ಹುಡುಕು ಕಳಿಸುವ ಪ್ರತಿ ಕೋರಿಕೆಯಲ್ಲೂ ಒಂದೇ ಹೆಸರು:
HudukuBot/1.0 (+https://huduku.org/fetching)
HudukuBot ಬೇರೆ ಯಾವ ಹೆಸರಿನಲ್ಲೂ ಕೇಳುವುದಿಲ್ಲ. ಪ್ರಾಕ್ಸಿ ಬಳಸುವುದಿಲ್ಲ, ಮನುಷ್ಯನಂತೆ ನಟಿಸುವ ಬ್ರೌಸರ್ ಬಳಸುವುದಿಲ್ಲ, ಬೇರೆಯವರು ಇಟ್ಟುಕೊಂಡ ತಾಣದ ನಕಲನ್ನೂ ಬಳಸುವುದಿಲ್ಲ. ಪ್ರಕಾಶಕರ ಬದಲಿಗೆ Google News ಅಥವಾ ಬೇರೆ ಸಂಗ್ರಾಹಕವನ್ನು ಅದು ಎಂದಿಗೂ ಓದುವುದಿಲ್ಲ.
ಅದು ತೆಗೆದುಕೊಳ್ಳುವುದು
- ಪ್ರಕಾಶಕರದೇ ಫೀಡ್ (RSS ಅಥವಾ Atom), ಅವರ ಸುದ್ದಿ ಸೈಟ್ಮ್ಯಾಪ್, ಅಥವಾ ಕೆಲವು ತಾಣಗಳಲ್ಲಿ ಅವರದೇ ಮುಖಪುಟದ ಮುಖ್ಯಾಂಶಗಳ ಪಟ್ಟಿಯಿಂದ: ಪ್ರತಿಯೊಂದರ ಮುಖ್ಯಾಂಶ, ಕೊಂಡಿ, ಪ್ರಕಟವಾದ ಸಮಯ ಮತ್ತು ಅದನ್ನು ಪ್ರಕಟಿಸಿದ ಮಾಧ್ಯಮ.
- ಫೀಡ್ ಕೊಟ್ಟರೆ, ಬರಹವನ್ನು ಸೇರಿಸಿದ ವರ್ಗ (ಪ್ರಕಾಶಕರು ಹೇಳಿದಾಗ ಮಾತ್ರ ಹುಡುಕು "ಅಭಿಪ್ರಾಯ" ಎನ್ನಲು), ಮತ್ತು ನಿಯತಕಾಲಿಕಗಳಲ್ಲಿ ಲೇಖಕರ ಸಾಲು; ಅದನ್ನು ಹುಡುಕು ತೋರಿಸುವುದಿಲ್ಲ.
- ಫೀಡ್ನಲ್ಲಿರುವ ಸಾರಾಂಶವನ್ನು ಮುಖ್ಯಾಂಶವನ್ನು ಒಂದು ವಿಷಯದಡಿ ಸೇರಿಸಲು, ಅದು ಕೈಯಲ್ಲಿರುವಾಗಲೇ, ಓದಲಾಗುತ್ತದೆ; ಉಳಿಸಿಕೊಳ್ಳುವುದಿಲ್ಲ. ಲೇಖನದ ಪಠ್ಯ, ಚಿತ್ರಗಳು ಅಥವಾ ಲೋಗೊಗಳನ್ನು ಹುಡುಕು ತರುವುದಿಲ್ಲ.
- ಲೇಖನವನ್ನು ಹಿಂತೆಗೆದುಕೊಳ್ಳಲಾಗಿದೆಯೇ ಎಂದು ನೋಡಲು, ಸಾರ್ವಜನಿಕ ಮುಖ್ಯಾಂಶದ ಕೊಂಡಿಯನ್ನು ಅದು ಎರಡು ದಿನ ಹಳೆಯದಾದಾಗ ಮತ್ತು ಹದಿನಾರು ದಿನವಾದಾಗ ಒಮ್ಮೆ, ಅದರ ಶೀರ್ಷಿಕೆ-ಮಾಹಿತಿ (headers) ಮಾತ್ರ ಕೇಳುವ ಒಂದು ಕೋರಿಕೆಯಿಂದ, ಕೇಳುತ್ತದೆ (ತೆಗೆದುಹಾಕುವಿಕೆ ನೋಡಿ).
ಎಷ್ಟು ಬಾರಿ
- ಪ್ರತಿ ಫೀಡ್ ಅಥವಾ ಸೈಟ್ಮ್ಯಾಪ್ ಅನ್ನು ಸುಮಾರು ಗಂಟೆಗೊಮ್ಮೆ ಓದಲಾಗುತ್ತದೆ.
- ತಾಣದ robots.txt ಅನ್ನು ಸುಮಾರು ದಿನಕ್ಕೊಮ್ಮೆ ಓದಿ, ಆ ದಿನಕ್ಕೆ ಇಟ್ಟುಕೊಳ್ಳಲಾಗುತ್ತದೆ.
- ಒಂದು ತಾಣದಿಂದ ಒಮ್ಮೆಗೆ ಒಂದನ್ನೇ ಕೇಳುತ್ತದೆ; ಹಲವನ್ನು ಒಟ್ಟಿಗೆ ಎಂದೂ ಕೇಳುವುದಿಲ್ಲ.
ಅದು ಪಾಲಿಸುವ ನಿಯಮಗಳು
- ಮೊದಲು robots.txt. ಯಾವುದೇ ಕೋರಿಕೆಗೆ ಮುನ್ನ HudukuBot ತಾಣದ robots.txt ಓದುತ್ತದೆ;
HudukuBotಗೆ ನಿಯಮಗಳಿದ್ದರೆ ಅವನ್ನು, ಇಲ್ಲದಿದ್ದರೆ*ಗೆ ಇರುವವನ್ನು ಪಾಲಿಸುತ್ತದೆ. ಅವು ಬೇಡವೆನ್ನುವ ದಾರಿಯನ್ನು ಕೇಳುವುದಿಲ್ಲ.search=noಎಂಬ ವಿಷಯ-ಸೂಚನೆ (content signal) ನಿರಾಕರಣೆಗೆ ಸಮ: ಮುಖ್ಯಾಂಶ ಮತ್ತು ಕೊಂಡಿ ಹುಡುಕಾಟದ ಬಳಕೆಗೆ ಹತ್ತಿರ. robots.txt ತಾನೇ 401 ಅಥವಾ 403 ಉತ್ತರಿಸಿದರೆ, ಇಡೀ ತಾಣ ನಿರಾಕರಿಸಿದೆ ಎಂದು ತಿಳಿಯಲಾಗುತ್ತದೆ. robots.txt ಅನ್ನು ಪ್ರತಿದಿನ ಅದು ಇರುವಂತೆ ಪಾಲಿಸಲಾಗುತ್ತದೆ: ಅದನ್ನು ಬದಲಿಸಿದರೆ HudukuBot ಹಿಂಬಾಲಿಸುತ್ತದೆ. - ನಿರಾಕರಣೆ ಅಂತಿಮ. ಕೋರಿಕೆಗೆ 401, 403 ಅಥವಾ 451, ಅಥವಾ ತಡೆಗೋಡೆ (challenge) ಪುಟ ಉತ್ತರ ಬಂದರೆ, HudukuBot ಆ ಮೂಲವನ್ನು ಓದುವುದನ್ನು ನಿಲ್ಲಿಸುತ್ತದೆ. ಬೇರೆ ದಾರಿಯಲ್ಲಿ ಮತ್ತೆ ಪ್ರಯತ್ನಿಸುವುದಿಲ್ಲ; ಪ್ರಕಾಶಕರು ಅನುಮತಿ ಕೊಟ್ಟಾಗ ಅಥವಾ ತಡೆಯನ್ನು ತೆಗೆದಾಗ, ಕಾರಣವನ್ನು ದಾಖಲಿಸಿ, ಮಾತ್ರ ಆ ಮೂಲ ಮರಳುತ್ತದೆ.
- ಕಾಯಲು ಹೇಳಿದರೆ ಕಾಯುತ್ತದೆ. 429 ಅಥವಾ 503 ಬಂದರೆ
Retry-Afterಹೇಳುವಷ್ಟು ಹೊತ್ತು, ಕನಿಷ್ಠ ಒಂದು ಗಂಟೆ, ಕಾಯುತ್ತದೆ. ಸತತ ಮೂರು ಬಾರಿ ಹಾಗೆ ಬಂದರೆ, ಹುಡುಕುವಿನಲ್ಲಿ ಯಾರಾದರೂ ನೋಡುವವರೆಗೆ ನಿಲ್ಲುತ್ತದೆ.
ಹೊರಗುಳಿಯುವುದು
- ನಿಮ್ಮ ಪ್ರಕಟಣೆಯ ಡೊಮೇನ್ನ ವಿಳಾಸದಿಂದ contact@huduku.org ಗೆ ಮಾಧ್ಯಮ ಅಥವಾ ತಾಣದ ಹೆಸರಿನೊಂದಿಗೆ ಒಂದು ಇಮೇಲ್ ಬರೆಯಿರಿ. 48 ಗಂಟೆಗಳೊಳಗೆ ಹುಡುಕು ಅದನ್ನು ತರುವುದನ್ನು ನಿಲ್ಲಿಸಿ, ಅದರ ಮುಖ್ಯಾಂಶಗಳನ್ನು ಎಲ್ಲ ಸಾರ್ವಜನಿಕ ಪುಟಗಳಿಂದ ತೆಗೆಯುತ್ತದೆ.
- ಅಥವಾ ನಿಮ್ಮ robots.txt ನಲ್ಲಿ
HudukuBotಅನ್ನು ತಡೆಯಿರಿ: ಕಡತವನ್ನು ಮುಂದೆ ಓದಿದಾಗ, ಒಂದು ದಿನದೊಳಗೆ, ಜಾರಿಗೆ ಬರುತ್ತದೆ. - ಅನುಮತಿ ಕೊಡುವುದು ಅಥವಾ ತಡೆಯುವುದು ಸೇರಿದಂತೆ ಪ್ರಕಾಶಕರಿಗೆ ಇನ್ನಷ್ಟು: ಪ್ರಕಾಶಕರಿಗೆ. ಒಂದೇ ಮುಖ್ಯಾಂಶವನ್ನು ತೆಗೆಸಲು: ತೆಗೆದುಹಾಕುವಿಕೆ.
ವಿಡಿಯೊಗಳು
ಕೆಲವು YouTube ಚಾನೆಲ್ಗಳ ವಿಡಿಯೊಗಳನ್ನು ಹುಡುಕು YouTubeನದೇ API ಮೂಲಕ, ತನ್ನ ಕೀಲಿಯೊಂದಿಗೆ, ಪಟ್ಟಿ ಮಾಡುತ್ತದೆ; HudukuBot YouTubeನಿಂದ ಏನನ್ನೂ ತರುವುದಿಲ್ಲ. ಏನನ್ನು ಉಳಿಸಲಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ಗೌಪ್ಯತೆ ಪುಟ ಹೇಳುತ್ತದೆ.