ساخت تصویر با هوش مصنوعی؛ راهنمای عملی نوشتن پرامپت تصویری
یک نمونه واقعی از خروجی مدل تصویری، پنج چیزی که باید در درخواست بگویید، و محدودیتهایی مثل متن فارسی که داخل تصویر خوانا درنمیآید.
ساخت تصویر با هوش مصنوعی سادهتر از چیزی است که به نظر میرسد: یک جمله مینویسید و چند ثانیه بعد تصویری دارید که قبلاً وجود نداشت. کاری که سختتر است، گرفتن همان تصویری است که در ذهن داشتید.
در این راهنما دو تصویر واقعی را کنار هم میگذاریم: یکی از یک درخواست چهارکلمهای و یکی از یک درخواست دقیق. هر دو با یک مدل و در یک روز ساخته شدهاند، پس تفاوتشان فقط به متن درخواست برمیگردد. محدودیتهای واقعی این مدلها را هم بدون تعارف میگوییم.
یک نمونه واقعی با سادهترین درخواست ممکن
این درخواست را دادیم: «یک تصویر از یک کافه». نه سبک گفتیم، نه زاویه دوربین، نه نور، نه اینکه داخل باشد یا بیرون. نتیجه در حدود 4 ثانیه آماده شد:

خروجی واقعی مدل Nano Banana 2 Lite در تاپگیفت AI، تاریخ 1405/06/29، نسبت تصویر 16:9.
نتیجه برای یک درخواست چهارکلمهای خوب است: فضای داخلی یک کافه، نور طبیعی از پنجره، میزهای چوبی، آدمهایی که پشت لپتاپ نشستهاند. مدل خودش تصمیم گرفته که کافه ایرانی باشد، ساعت روز باشد و شلوغ باشد — هیچکدام را ما نگفته بودیم.
حالا به جزئیات نگاه کنید
اگر تصویر را بزرگ کنید، دو چیز را میبینید که در بیشتر تصاویر ساختهشده با هوش مصنوعی تکرار میشود:
متن روی تختهسیاه منو بیمعنی است. حروف شبیه فارسیاند ولی کلمه نیستند. مدلهای تصویری متن را مثل الگوی تصویری یاد میگیرند، نه مثل زبان؛ به همین دلیل متن فارسی داخل تصویر تقریباً همیشه خراب درمیآید.
جزئیات دست و شیء در حاشیه تصویر دقیق نیستند. هرچه از مرکز تصویر دورتر شوید، احتمال خطا در جزئیات بیشتر میشود.
این دو محدودیت مهماند چون تعیین میکنند تصویر ساختهشده کجا به کار میآید و کجا نه. برای فضاسازی و تصویر پسزمینه عالی است؛ برای پوستری که باید متن فارسی خوانا داشته باشد، نه — متن را باید بعداً خودتان روی تصویر بگذارید.
یک درخواست تصویری خوب چه چیزهایی دارد؟
هرچه بیشتر بگویید، مدل کمتر حدس میزند. این پنج چیز بیشترین اثر را دارند:
1. موضوع مشخص
«یک کافه» در برابر «فضای داخلی یک کافه کوچک با پنجره بزرگ رو به خیابان و دو میز چوبی». هرچه موضوع دقیقتر باشد، شانس اینکه چیزی بگیرید که میخواستید بیشتر است.
2. سبک
عکاسی واقعگرایانه، تصویرسازی تخت، نقاشی آبرنگ، رندر سهبعدی؟ اگر نگویید، مدل معمولاً عکاسی واقعگرایانه را انتخاب میکند.
3. نور و فضا
نور طبیعی صبح، نور گرم عصر، فضای کمنور با چراغهای نقطهای. نور بیشتر از هر چیز دیگری حالوهوای تصویر را میسازد.
4. ترکیببندی و زاویه
نمای نزدیک، نمای باز، از بالا، همسطح چشم. اگر تصویر قرار است جایی مثل کاور یا بنر استفاده شود، بگویید کجای تصویر باید خالی بماند تا بعداً متن رویش بنشیند.
5. آنچه نمیخواهید
«بدون آدم»، «بدون متن»، «بدون لوگو». گفتن چیزهای ناخواسته معمولاً مؤثرتر از توضیح دادن چیزهای خواسته است.
یک نکته عملی: بهجای نوشتن یک پاراگراف طولانی، این موارد را پشت سر هم و با ویرگول بنویسید. مدلهای تصویری به فهرست ویژگیها بهتر جواب میدهند تا به جملههای داستانی.
همان صحنه، این بار با یک درخواست دقیق
حالا همان کافه را با درخواستی خواستیم که هر پنج مورد بالا را داشت:
فضای داخلی یک کافه کوچک محلهای، نمای همسطح چشم از گوشه سالن، یک میز چوبی روشن در پیشزمینه با یک فنجان قهوه و یک دفترچه بسته، پنجره بزرگ در سمت راست با نور ملایم صبح، رنگهای گرم و آرام، عکاسی واقعگرایانه با عمق میدان کم، بدون آدم، بدون هیچ متن و نوشتهای، بدون لوگو، سمت چپ تصویر خلوت بماند

خروجی واقعی همان مدل، همان روز، همان نسبت تصویر 16:9.
چهار تفاوتی که مستقیماً از متن درخواست آمدهاند:
هیچ آدمی در تصویر نیست. تصویر اول پر از آدم بود، چون چیزی نگفته بودیم؛ اینبار «بدون آدم» را خواستیم.
هیچ متن بیمعنایی در تصویر نیست. با حذف تختهسیاه و منو، آن مشکل همیشگی متن فارسی هم حذف شد. این سادهترین راه دورزدن آن محدودیت است: متن را از صحنه بیرون بگذارید.
سوژه مشخص در پیشزمینه. میز چوبی با فنجان و دفترچه، همان چیزی که خواسته بودیم؛ در تصویر اول هیچ سوژه مشخصی وجود نداشت و چشم جایی برای نشستن نداشت.
جای خالی برای متن. چون گفته بودیم سمت چپ خلوت بماند، حالا میشود روی آن بخش عنوان یا لوگو گذاشت. این نکته برای کاور، بنر و تصویر شاخص مقاله تفاوت بزرگی میسازد.
هر دو تصویر را یک مدل ساخته و هزینهشان هم یکسان بوده است. تنها چیزی که فرق کرده، متنی است که نوشتهایم.
یک نکته منصفانه: تصویر دوم لزوماً «بهتر» نیست، بلکه نزدیکتر به چیزی است که خواسته بودیم. اگر واقعاً به تصویری از یک کافه شلوغ و پرجنبوجوش نیاز داشتید، تصویر اول جواب بهتری بود. هدف درخواست دقیق، کنترل است، نه زیبایی بیشتر.
اگر نتیجه آن چیزی نبود که میخواستید
یک چیز را در هر تلاش عوض کنید. اگر همزمان سبک و نور و زاویه را تغییر دهید، نمیفهمید کدام تغییر مؤثر بوده.
دوباره بسازید. همان درخواست، بار دوم نتیجه متفاوتی میدهد؛ گاهی همین کافی است.
توقع متن خوانا نداشته باشید. اگر متن لازم دارید، تصویر را بدون متن بسازید و نوشته را با یک ابزار ساده رویش بگذارید.
هزینه و محدودیتها را جدی بگیرید
ساخت تصویر معمولاً از یک پاسخ متنی گرانتر است. در تاپگیفت، مصرف اعتبار هر درخواست به مدل و قابلیتی که استفاده میکنید بستگی دارد و مدلهای تصویری با هم فرق دارند؛ فهرست مدلها و پلنها در جدول پلنها و مدلهای تاپگیفت AI آمده است. تصویر این مقاله با مدل اقتصادی تصویری ساخته شد که برای حسابهای بدون اشتراک هم فعال است.
تصویرهایی که میسازید در حساب خودتان میمانند و هر زمان میتوانید دوباره ببینید یا دانلودشان کنید.
چند نکته حقوقی و اخلاقی که بهتر است بدانید
چهره افراد واقعی را نسازید. ساختن تصویر از یک شخص مشخص، بدون اجازه او، هم مسئله حقوقی دارد و هم اخلاقی.
تصویر ساختهشده را بهعنوان عکس واقعی جا نزنید. اگر تصویر در خبر، گزارش یا محتوای مستند استفاده میشود، بنویسید که ساخته هوش مصنوعی است — همان کاری که در همین مقاله کردیم.
مراقب برند و اثر دیگران باشید. درخواست «به سبک فلان هنرمند زنده» یا ساختن لوگوی شبیه یک برند شناختهشده، شما را در موقعیت پرریسکی میگذارد.
جمعبندی
یک درخواست کوتاه، تصویر قابلقبولی میدهد؛ اما تصویری که دقیقاً به کار شما بیاید، از درخواستی میآید که موضوع، سبک، نور، ترکیببندی و چیزهای ناخواسته را مشخص کرده باشد. محدودیتها را هم بشناسید: متن فارسی داخل تصویر هنوز قابل اتکا نیست.
برای تمرین، دقیقاً همین کار را انجام دهید: یک تصویر با یک جمله کوتاه بسازید، بعد همان صحنه را با موضوع، سبک، نور، ترکیببندی و موارد ناخواسته دوباره بخواهید و دو نتیجه را کنار هم بگذارید. اگر با نوشتن درخواست راحت نیستید، راهنمای سؤالپرسیدن از هوش مصنوعی نقطه شروع خوبی است؛ و برای شروع کار میتوانید از اعتبار هدیه تاپگیفت AI استفاده کنید.