cURL을 사용하여 페이지 콘텐츠를 효과적으로 검색하려면 어떻게 해야 합니까?-PHP 튜토리얼-php.cn

cURL을 사용하여 페이지 콘텐츠를 효과적으로 검색하려면 어떻게 해야 합니까?

DDD

풀어 주다： 2024-10-22 20:54:29

원래의

579명이 탐색했습니다.

How Can I Retrieve Page Content Effectively with cURL?

cURL을 사용하여 페이지 콘텐츠를 검색하는 방법

cURL을 사용하여 페이지 콘텐츠를 스크랩하려고 하면 리디렉션 또는 "페이지 이동" 오류 문제가 발생할 수 있습니다. 특히 쿼리 문자열에 특수 문자가 포함되어 있습니다.

이 문제를 해결하려면 인코딩된 쿼리 문자열이 올바르게 처리되고 있는지 확인해야 합니다. 다음은 이 문제를 해결하는 향상된 코드 조각입니다.

<code class="php">/**
 * Function to retrieve a web page using cURL.
 */
function get_web_page(string $url): array
{
    $user_agent = 'Mozilla/5.0 (Windows NT 6.1; rv:8.0) Gecko/20100101 Firefox/8.0';

    $options = [
        CURLOPT_CUSTOMREQUEST  => "GET",        // Set request type as GET
        CURLOPT_POST           => false,        // Set to GET
        CURLOPT_USERAGENT      => $user_agent, // Set user agent
        CURLOPT_COOKIEFILE     => "cookie.txt", // Set cookie file
        CURLOPT_COOKIEJAR      => "cookie.txt", // Set cookie jar
        CURLOPT_RETURNTRANSFER => true,     // Return web page
        CURLOPT_HEADER         => false,    // Don't return headers
        CURLOPT_FOLLOWLOCATION => true,     // Follow redirects
        CURLOPT_ENCODING       => "",       // Handle all encodings
        CURLOPT_AUTOREFERER    => true,     // Set referer on redirect
        CURLOPT_CONNECTTIMEOUT => 120,      // Timeout on connect
        CURLOPT_TIMEOUT        => 120,      // Timeout on response
        CURLOPT_MAXREDIRS      => 10,       // Stop after 10 redirects
    ];

    $ch = curl_init($url);
    curl_setopt_array($ch, $options);
    $content = curl_exec($ch);
    $err = curl_errno($ch);
    $errmsg = curl_error($ch);
    $header = curl_getinfo($ch);
    curl_close($ch);

    $header['errno'] = $err;
    $header['errmsg'] = $errmsg;
    $header['content'] = $content;
    return $header;
}

// Example of using the function to get a web page:
$result = get_web_page('https://www.example.com/page');

if ($result['errno'] != 0) {
    // Handle error: bad url, timeout, redirect loop
}

if ($result['http_code'] != 200) {
    // Handle error: no page, no permissions, no service
}

$page = $result['content'];</code>

로그인 후 복사

요청 유형을 GET으로 설정하고, 사용자 에이전트를 제공하고, 모든 인코딩을 처리하는 등의 추가 옵션을 포함하면 성공적으로 작업을 수행할 수 있습니다. 원하는 웹페이지의 콘텐츠를 검색하세요.

위 내용은 cURL을 사용하여 페이지 콘텐츠를 효과적으로 검색하려면 어떻게 해야 합니까?의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!