| تعداد نشریات | 45 |
| تعداد شمارهها | 1,539 |
| تعداد مقالات | 18,776 |
| تعداد مشاهده مقاله | 62,773,537 |
| تعداد دریافت فایل اصل مقاله | 22,709,516 |
شبکه عصبی عمیق مبتنی بر دادههای جدولی برای استخراج خودکار محتوای اصلی صفحات وب | ||
| مجله مهندسی برق دانشگاه تبریز | ||
| مقالات آماده انتشار، اصلاح شده برای چاپ، انتشار آنلاین از تاریخ 28 شهریور 1405 | ||
| نوع مقاله: علمی-پژوهشی | ||
| شناسه دیجیتال (DOI): 10.22034/tjee.2026.72123.5154 | ||
| نویسندگان | ||
| آذین اکرامی فرد؛ هدی مشایخی* ؛ مرضیه رحیمی | ||
| دانشکده کامپیوتر، دانشگاه صنعتی شاهرود، شاهرود، ایران | ||
| چکیده | ||
| اینترنت منبع گستردهای از اطلاعات متنی است و استخراج هدفمند دادهها از صفحات وب میتواند مجموعهدادههای ارزشمندی برای کاربردهایی مانند آموزش مدلهای زبانی فراهم کند. با این حال، تنوع ساختار صفحات و وجود متنهای نامرتبط باعث میشود دادههای استخراجشده همراه با نویز باشند. روشهای موجود برای استخراج محتوای اصلی معمولاً در دو دسته قرار میگیرند: روشهای مبتنی بر قواعد که با تغییر فناوریها کارایی خود را از دست میدهند، و روشهای مبتنی بر یادگیری ماشین که به دلیل محدودیت دادههای آموزشی یا پیچیدگی مدلها، در طیف گستردهای از صفحات وب عملکرد مطلوبی ندارند. در این پژوهش، مدلی هوشمند برای استخراج محتوای اصلی صفحات وب با بهرهگیری از ویژگیهای متنوع عناصر صفحه پیشنهاد شده است. در روش ارائهشده، هر صفحه وب به مجموعهای از بلاکها تقسیم میشود و با استخراج ویژگیهای گوناگون از این بلاکها، برچسب هر یک با استفاده از یک مدل یادگیری عمیق پیشبینی میشود. از نوآوریهای این پژوهش میتوان به معرفی یک مدل یادگیری عمیق مبتنی بر دادههای جدولی و استفاده از وزنهای یک مدل کانولوشنی بهعنوان ویژگی جدید اشاره کرد. نتایج ارزیابی نشان میدهد که مدل پیشنهادی با کسب امتیاز F1 معادل 76/95 در معیار ROUGE-L، نسبت به سایر روشهای عملکرد بهتری داشته و حداقل 5/4 درصد بهبود را نشان میدهد. | ||
| کلیدواژهها | ||
| استخراج محتوای صفحات وب؛ حذف محتوای غیرمفید؛ پردازش متن؛ دادهکاوی؛ یادگیری عمیق مبتنی بر دادههای جدولی | ||
| مراجع | ||
|
| ||
|
آمار تعداد مشاهده مقاله: 2 |
||